Realtime-Venus: A full-duplex interaction system with asynchronous delegation
Các tác giả giới thiệu Realtime-Venus, một hệ thống tương tác full-duplex chủ động gồm hai mô hình 9B riêng biệt (Realtime-Venus-Omni cho tương tác đa phương thức audio-visual và Realtime-Venus-Audio cho giọng nói). Hệ thống sử dụng một runtime hai vòng lặp (dual-loop) để phối hợp tương tác trực tiếp ở frontend với việc suy luận nền và thực thi công cụ thông qua một harness bất đồng bộ. Realtime-Venus-Omni đạt điểm số cao nhất trên sáu trong tám video benchmark (StreamingBench đạt 70.2%, OVO-Bench đạt 64.7%, và Daily-Omni đạt 81.3%), trong khi Realtime-Venus-Audio dẫn đầu các mô hình được so sánh trên nhiều audio benchmark như MMAU (78.0%), MMAU-Pro (63.2%), Llama Questions (83.8%), và Speech CMMLU (67.8%), đồng thời phản hồi 75% các ngắt quãng của người dùng trên Full-Duplex-Bench v1.5.
Realtime-Venus-Omni đạt điểm số cao nhất trên sáu trong số tám video benchmark, bao gồm StreamingBench (70.2%), OVO-Bench (64.7%) và Daily-Omni (81.3%).
Realtime-Venus-Audio dẫn đầu các mô hình được so sánh trên MMAU (78.0%), MMAU-Pro (63.2%), Llama Questions (83.8%) và Speech CMMLU (67.8%), đồng thời đạt điểm VoiceBench AlpacaEval là 4.81.
Trên Full-Duplex-Bench v1.5, Realtime-Venus-Audio phản hồi 75% các ngắt quãng của người dùng và đạt tỷ lệ tiếp tục là 97%, 88% và 86% lần lượt dưới các điều kiện backchannels, other-directed speech, và background speech.