StepAudio 3 Realtime Technical Report
L'article présente StepAudio 3 Realtime, un modèle de fondation audio-langage articulé autour d'une boucle continue d'écoute, de conversation, de réflexion et d'action. Pour résoudre la tension entre délibération approfondie et faible latence, il introduit la fonction Think-While-Speaking, exécutant un raisonnement privé en parallèle de la production vocale. Un agent vocal intégré gère l'exécution d'outils de manière asynchrone. StepAudio 3 Realtime atteint de solides performances, dont une moyenne macro de 73,0 sur StepAudioChat, 90,6 sur le benchmark MMSU et 98,9 Overall sur Artificial Analysis Full-Duplex Bench.
En mode raisonnement, StepAudio 3 atteint une moyenne macro de 73,0 sur StepAudioChat.
Il obtient un score exceptionnel de 90,6 sur le benchmark MMSU et de 98,9 Overall sur Artificial Analysis Full-Duplex Bench.
Il atteint un taux de réussite de tâche macro de 56,0 % sur τ-Voice.