CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 12 votes

Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents

QUESTION — Comment les Audio LLM actuels gèrent-ils le déclenchement basé sur le contexte acoustique pour l'exécution d'actions dans les agents vocaux ?

Les auteurs présentent VGBench, un benchmark de diagnostic de 1 018 éléments pour l'adressage au niveau des actions dans des scénarios de side-talk, self-talk et de changement de locuteur. À l'aide de ce benchmark, ils constatent que les Audio LLM bruts et les adaptations sans entraînement identifient souvent l'outil cible mais retiennent rarement l'action lors de changements de locuteur, le taux de mise en sourdine brut le plus élevé étant de 14 %. Ils utilisent VoxGate comme étude de cas de post-entraînement, démontrant que l'entraînement supervisé met en sourdine 91,3 % des commandes modifiées tout en choisissant le bon outil pour les commandes du porteur à proximité. Une étape GRPO exploratoire améliore encore la précision du side-talk et la mise en sourdine du self-talk.

VGBench est un benchmark de diagnostic de 1 018 éléments mesurant le déclenchement basé sur le contexte acoustique multi-indices.

Les Audio LLM bruts atteignent un taux de mise en sourdine brut maximal de 14 % lors des changements.

L'entraînement supervisé dans VoxGate met en sourdine 91,3 % des commandes modifiées tout en choisissant le bon outil pour les commandes du porteur à proximité.

Yushi98 · 26 sept. 2026 lire l'original ↗
↑