CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 24 upvote

OmniEcho: Spatial Audio Understanding for Embodied Agents

CÂU HỎI — Làm thế nào để đánh giá và mô hình hóa hiểu biết âm thanh không gian trong các môi trường agent tương tác thực tế (embodied settings)?

Nghiên cứu giải quyết bài toán thiếu hụt chuẩn đánh giá âm thanh không gian cho embodied agent bằng cách giới thiệu OmniEchoBench, một benchmark tích hợp gồm 6 tác vụ trên 197 cảnh không gian âm thanh - hình ảnh thực tế, 2.972 cặp câu hỏi - trả lời và 900 sample điều hướng âm thanh FOA thu thập từ 30 môi trường. Đồng thời, tác giả phát triển pipeline rendering điều khiển được và đề xuất OmniEcho, một mô hình đa modal tích hợp FOA spatial encoder. Kết quả thực nghiệm chứng minh model đạt state-of-the-art về nhận thức không gian âm thanh hình ảnh.

OmniEchoBench tích hợp 6 task trên 197 cảnh không gian thực tế với 2.972 cặp Q&A và 900 sample điều hướng.

Dữ liệu sử dụng first-order ambisonics (FOA) audio thu thập từ 30 môi trường thực tế.

OmniEcho tích hợp FOA spatial encoder để đạt kết quả state-of-the-art trong không gian âm thanh - hình ảnh.

lrx123 · 20 thg 9, 2026 đọc bản gốc ↗
↑