OmniEcho: Spatial Audio Understanding for Embodied Agents
Cette recherche comble les lacunes d'évaluation de l'audio spatial pour les agents incarnés en introduisant OmniEchoBench, un benchmark comprenant six tâches sur 197 scènes audio-visuelles réelles, 2 972 paires Q-R et 900 échantillons de navigation collectés à partir de 30 environnements en audio ambisonique du premier ordre (FOA). Les auteurs développent un pipeline de rendu contrôlable et proposent OmniEcho, un modèle omni-modal spatialement conscient doté d'un encodeur spatial FOA.
OmniEchoBench propose six tâches sur 197 scènes réelles avec 2 972 paires Q-R et 900 échantillons de navigation.
Les données utilisent l'audio ambisonique du premier ordre (FOA) collecté dans 30 environnements réels.
OmniEcho intègre un encodeur spatial FOA pour atteindre des performances de pointe en perception audio-visuelle spatiale.