CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 24 votes

OmniEcho: Spatial Audio Understanding for Embodied Agents

QUESTION — Comment évaluer et modéliser efficacement la compréhension audio spatiale dans des environnements d'agents incarnés ?

Cette recherche comble les lacunes d'évaluation de l'audio spatial pour les agents incarnés en introduisant OmniEchoBench, un benchmark comprenant six tâches sur 197 scènes audio-visuelles réelles, 2 972 paires Q-R et 900 échantillons de navigation collectés à partir de 30 environnements en audio ambisonique du premier ordre (FOA). Les auteurs développent un pipeline de rendu contrôlable et proposent OmniEcho, un modèle omni-modal spatialement conscient doté d'un encodeur spatial FOA.

OmniEchoBench propose six tâches sur 197 scènes réelles avec 2 972 paires Q-R et 900 échantillons de navigation.

Les données utilisent l'audio ambisonique du premier ordre (FOA) collecté dans 30 environnements réels.

OmniEcho intègre un encodeur spatial FOA pour atteindre des performances de pointe en perception audio-visuelle spatiale.

lrx123 · 20 sept. 2026 lire l'original ↗
↑