CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 217 upvote

Realtime-Venus: A full-duplex interaction system with asynchronous delegation

CÂU HỎI — Làm thế nào để xây dựng một hệ thống tương tác full-duplex tích hợp khả năng nhận thức liên tục, điều khiển cuộc hội thoại và thực thi tác vụ nền bất đồng bộ bằng các 9B model?

Các tác giả giới thiệu Realtime-Venus, một hệ thống tương tác full-duplex chủ động gồm hai mô hình 9B riêng biệt (Realtime-Venus-Omni cho tương tác đa phương thức audio-visual và Realtime-Venus-Audio cho giọng nói). Hệ thống sử dụng một runtime hai vòng lặp (dual-loop) để phối hợp tương tác trực tiếp ở frontend với việc suy luận nền và thực thi công cụ thông qua một harness bất đồng bộ. Realtime-Venus-Omni đạt điểm số cao nhất trên sáu trong tám video benchmark (StreamingBench đạt 70.2%, OVO-Bench đạt 64.7%, và Daily-Omni đạt 81.3%), trong khi Realtime-Venus-Audio dẫn đầu các mô hình được so sánh trên nhiều audio benchmark như MMAU (78.0%), MMAU-Pro (63.2%), Llama Questions (83.8%), và Speech CMMLU (67.8%), đồng thời phản hồi 75% các ngắt quãng của người dùng trên Full-Duplex-Bench v1.5.

Realtime-Venus-Omni đạt điểm số cao nhất trên sáu trong số tám video benchmark, bao gồm StreamingBench (70.2%), OVO-Bench (64.7%) và Daily-Omni (81.3%).

Realtime-Venus-Audio dẫn đầu các mô hình được so sánh trên MMAU (78.0%), MMAU-Pro (63.2%), Llama Questions (83.8%) và Speech CMMLU (67.8%), đồng thời đạt điểm VoiceBench AlpacaEval là 4.81.

Trên Full-Duplex-Bench v1.5, Realtime-Venus-Audio phản hồi 75% các ngắt quãng của người dùng và đạt tỷ lệ tiếp tục là 97%, 88% và 86% lần lượt dưới các điều kiện backchannels, other-directed speech, và background speech.

AdinaY · 12 thg 9, 2026 đọc bản gốc ↗
↑