Realtime-Venus: A full-duplex interaction system with asynchronous delegation
Les auteurs présentent Realtime-Venus, un système d'interaction full-duplex proactif composé de deux modèles de 9B entraînés séparément : Realtime-Venus-Omni pour l'interaction audio-visuelle et Realtime-Venus-Audio pour la parole. Le système intègre un runtime à double boucle qui coordonne l'interaction en direct avec le raisonnement en arrière-plan et l'exécution d'outils via un harness asynchrone. Realtime-Venus-Omni obtient les scores les plus élevés sur six des huit benchmarks vidéo (StreamingBench à 70,2%, OVO-Bench à 64,7%, et Daily-Omni à 81,3%), tandis que Realtime-Venus-Audio surpasse les modèles comparés sur plusieurs benchmarks audio tels que MMAU (78,0%), MMAU-Pro (63,2%), Llama Questions (83,8%), et Speech CMMLU (67,8%), tout en répondant à 75% des interruptions utilisateur sur Full-Duplex-Bench v1.5.
Realtime-Venus-Omni obtient les scores les plus élevés sur six des huit benchmarks vidéo, notamment StreamingBench (70,2%), OVO-Bench (64,7%) et Daily-Omni (81,3%).
Realtime-Venus-Audio devance les modèles comparés sur MMAU (78,0%), MMAU-Pro (63,2%), Llama Questions (83,8%) et Speech CMMLU (67,8%), tout en égalant le meilleur score VoiceBench AlpacaEval de 4,81.
Sur Full-Duplex-Bench v1.5, Realtime-Venus-Audio répond à 75% des interruptions utilisateur et atteint des taux de continuation de 97%, 88% et 86% sous les conditions backchannels, other-directed speech, et background speech, respectivement.