CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 12 upvote

Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents

CÂU HỎI — Các Audio LLM hiện tại xử lý việc kích hoạt hành động theo ngữ cảnh âm thanh trong voice agent ra sao?

Nhóm tác giả giới thiệu VGBench, một benchmark chẩn đoán gồm 1.018 mục để đánh giá action-level addressedness trong các kịch bản side-talk, self-talk và speaker-switch. Thông qua benchmark này, họ phát hiện ra rằng các Audio LLM thô và các bản thích ứng không cần huấn luyện thường nhận diện đúng tool mục tiêu nhưng hiếm khi chịu dừng hành động (mute) khi bối cảnh thay đổi, với tỷ lệ mute cao nhất chỉ đạt 14%. Họ sử dụng VoxGate làm nghiên cứu điển hình post-training, chứng minh rằng việc huấn luyện giám sát giúp tắt 91,3% các lệnh chuyển đổi người nói, đồng thời vẫn chọn đúng công cụ cho các lệnh của người đeo ở gần. Giai đoạn GRPO bổ sung giúp cải thiện độ chính xác side-talk và khả năng tắt tiếng ở self-talk.

VGBench là benchmark chẩn đoán 1.018 mục đo lường multi-cue acoustic-context gating.

Các Audio LLM thô có tỷ lệ mute khi chuyển đổi người nói tối đa là 14%.

Supervised training với VoxGate giúp mute 91,3% các lệnh đã chuyển đổi hướng đi người nói.

Yushi98 · 26 thg 9, 2026 đọc bản gốc ↗
↑