CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 49 votes

PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation

QUESTION — Comment exploiter efficacement les observations panoramiques dans les tâches de navigation vision-langage ?

Ce travail explore la navigation vision-langage (VLN) à l'aide d'observations panoramiques et présente PanoVLN pour expliquer pourquoi le simple remplacement d'images en perspective n'apporte que des gains limités. Les auteurs diagnostiquent qu'une exploitation complète nécessite des modifications de la prédiction des actions, de la supervision de l'entraînement et de la représentation visuelle. Plus précisément, ils introduisent une stratégie d'exécution guidée par la confiance (CGE) pour la planification d'actions à plus long terme, construisent des routes d'entraînement avec des points de branchement fréquents, et combinent des caractéristiques sémantiques et géométriques de panoramas RGB sans ajouter de jetons visuels. Avec un squelette de 4B et une entrée RGB seule, PanoVLN dépasse l'état de l'art précédent sur R2R-CE et RxR-CE Val-Unseen.

PanoVLN dépasse l'état de l'art précédent de 11,9% et 8,7% en taux de réussite sur R2R-CE et RxR-CE Val-Unseen.

Le modèle utilise un squelette de 4B et une entrée RGB uniquement.

Des expériences dans le monde réel sur un quadruède démontrent une navigation plus rapide avec moins de pauses que les méthodes VLN antérieures.

xichenhku · 28 sept. 2026 lire l'original ↗
↑