CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 31 votes

VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering

QUESTION — Quelles sont les performances des modèles propriétaires et open-weight sur la réponse aux questions factuelles parlées en Telugu, et quelle est la fiabilité des méthodes d'évaluation automatique ?

Les auteurs présentent VākQA, un banc d'essai de réponse aux questions parlées en Telugu comprenant 2 001 paires question-réponse factuelles sur six domaines avec 2,53 heures d'audio, des transcriptions bilingues et des réponses vérifiées. En évaluant les mesures automatisées par rapport aux jugements humains, ils constatent que Gemini comme juge s'approche le mieux des notes humaines, tandis que les juges open-weight pénalisent systématiquement les réponses correctes. Les tests révèlent que les erreurs ASR-MT en cascade s'aggravent progressivement.

VākQA fournit 2 001 paires question-réponse factuelles sur six domaines avec 2,53 heures d'audio en Telugu.

Gemini-as-a-judge approxime le mieux les évaluations humaines tandis que les juges open-weight pénalisent systématiquement les réponses correctes.

Bhavanaakkiraju · 17 sept. 2026 lire l'original ↗
↑