CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 127 upvote

StepAudio 3 Realtime Technical Report

CÂU HỎI — Làm thế nào để cân bằng giữa năng lực suy luận sâu và độ trễ thấp trong các hệ thống tương tác giọng nói thời gian thực?

Bài báo giới thiệu StepAudio 3 Realtime, một mô hình nền tảng âm thanh-ngôn ngữ vận hành theo vòng lặp nghe-đối thoại-suy nghĩ-hành động liên tục. Để giải quyết mâu thuẫn giữa suy luận sâu và độ trễ phản hồi, hệ thống áp dụng kỹ thuật Think-While-Speaking, thực thi suy luận riêng tư song song với việc phát âm thanh phản hồi. Tác nhân giọng nói tích hợp xử lý việc thực thi công cụ bất đồng bộ mà không làm gián đoạn dòng đối thoại. Mô hình đạt kết quả vượt trội bao gồm 73.0 điểm macro trung bình trên StepAudioChat, 90.6 trên benchmark MMSU và 98.9 Overall trên Artificial Analysis Full-Duplex Bench.

Đạt 73.0 điểm macro trung bình trên StepAudioChat trong chế độ suy luận.

Đạt điểm số đặc biệt cao 90.6 trên benchmark MMSU và 98.9 Overall trên Artificial Analysis Full-Duplex Bench.

Đạt tỷ lệ thành công tác vụ theo macro là 56.0% trên τ-Voice.

yanchaomars · 12 thg 9, 2026 đọc bản gốc ↗
↑