Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents
Les auteurs présentent VGBench, un benchmark de diagnostic de 1 018 éléments pour l'adressage au niveau des actions dans des scénarios de side-talk, self-talk et de changement de locuteur. À l'aide de ce benchmark, ils constatent que les Audio LLM bruts et les adaptations sans entraînement identifient souvent l'outil cible mais retiennent rarement l'action lors de changements de locuteur, le taux de mise en sourdine brut le plus élevé étant de 14 %. Ils utilisent VoxGate comme étude de cas de post-entraînement, démontrant que l'entraînement supervisé met en sourdine 91,3 % des commandes modifiées tout en choisissant le bon outil pour les commandes du porteur à proximité. Une étape GRPO exploratoire améliore encore la précision du side-talk et la mise en sourdine du self-talk.
VGBench est un benchmark de diagnostic de 1 018 éléments mesurant le déclenchement basé sur le contexte acoustique multi-indices.
Les Audio LLM bruts atteignent un taux de mise en sourdine brut maximal de 14 % lors des changements.
L'entraînement supervisé dans VoxGate met en sourdine 91,3 % des commandes modifiées tout en choisissant le bon outil pour les commandes du porteur à proximité.