StepAudio 3 Realtime Technical Report
Bài báo giới thiệu StepAudio 3 Realtime, một mô hình nền tảng âm thanh-ngôn ngữ vận hành theo vòng lặp nghe-đối thoại-suy nghĩ-hành động liên tục. Để giải quyết mâu thuẫn giữa suy luận sâu và độ trễ phản hồi, hệ thống áp dụng kỹ thuật Think-While-Speaking, thực thi suy luận riêng tư song song với việc phát âm thanh phản hồi. Tác nhân giọng nói tích hợp xử lý việc thực thi công cụ bất đồng bộ mà không làm gián đoạn dòng đối thoại. Mô hình đạt kết quả vượt trội bao gồm 73.0 điểm macro trung bình trên StepAudioChat, 90.6 trên benchmark MMSU và 98.9 Overall trên Artificial Analysis Full-Duplex Bench.
Đạt 73.0 điểm macro trung bình trên StepAudioChat trong chế độ suy luận.
Đạt điểm số đặc biệt cao 90.6 trên benchmark MMSU và 98.9 Overall trên Artificial Analysis Full-Duplex Bench.
Đạt tỷ lệ thành công tác vụ theo macro là 56.0% trên τ-Voice.