VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering
Les auteurs présentent VākQA, un banc d'essai de réponse aux questions parlées en Telugu comprenant 2 001 paires question-réponse factuelles sur six domaines avec 2,53 heures d'audio, des transcriptions bilingues et des réponses vérifiées. En évaluant les mesures automatisées par rapport aux jugements humains, ils constatent que Gemini comme juge s'approche le mieux des notes humaines, tandis que les juges open-weight pénalisent systématiquement les réponses correctes. Les tests révèlent que les erreurs ASR-MT en cascade s'aggravent progressivement.
VākQA fournit 2 001 paires question-réponse factuelles sur six domaines avec 2,53 heures d'audio en Telugu.
Gemini-as-a-judge approxime le mieux les évaluations humaines tandis que les juges open-weight pénalisent systématiquement les réponses correctes.