CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 127 votes

StepAudio 3 Realtime Technical Report

QUESTION — Comment concilier des capacités de raisonnement approfondi et une faible latence dans les systèmes d'interaction vocale en temps réel ?

L'article présente StepAudio 3 Realtime, un modèle de fondation audio-langage articulé autour d'une boucle continue d'écoute, de conversation, de réflexion et d'action. Pour résoudre la tension entre délibération approfondie et faible latence, il introduit la fonction Think-While-Speaking, exécutant un raisonnement privé en parallèle de la production vocale. Un agent vocal intégré gère l'exécution d'outils de manière asynchrone. StepAudio 3 Realtime atteint de solides performances, dont une moyenne macro de 73,0 sur StepAudioChat, 90,6 sur le benchmark MMSU et 98,9 Overall sur Artificial Analysis Full-Duplex Bench.

En mode raisonnement, StepAudio 3 atteint une moyenne macro de 73,0 sur StepAudioChat.

Il obtient un score exceptionnel de 90,6 sur le benchmark MMSU et de 98,9 Overall sur Artificial Analysis Full-Duplex Bench.

Il atteint un taux de réussite de tâche macro de 56,0 % sur τ-Voice.

yanchaomars · 12 sept. 2026 lire l'original ↗
↑