OmniEcho: Spatial Audio Understanding for Embodied Agents
Nghiên cứu giải quyết bài toán thiếu hụt chuẩn đánh giá âm thanh không gian cho embodied agent bằng cách giới thiệu OmniEchoBench, một benchmark tích hợp gồm 6 tác vụ trên 197 cảnh không gian âm thanh - hình ảnh thực tế, 2.972 cặp câu hỏi - trả lời và 900 sample điều hướng âm thanh FOA thu thập từ 30 môi trường. Đồng thời, tác giả phát triển pipeline rendering điều khiển được và đề xuất OmniEcho, một mô hình đa modal tích hợp FOA spatial encoder. Kết quả thực nghiệm chứng minh model đạt state-of-the-art về nhận thức không gian âm thanh hình ảnh.
OmniEchoBench tích hợp 6 task trên 197 cảnh không gian thực tế với 2.972 cặp Q&A và 900 sample điều hướng.
Dữ liệu sử dụng first-order ambisonics (FOA) audio thu thập từ 30 môi trường thực tế.
OmniEcho tích hợp FOA spatial encoder để đạt kết quả state-of-the-art trong không gian âm thanh - hình ảnh.