PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation
Ce travail explore la navigation vision-langage (VLN) à l'aide d'observations panoramiques et présente PanoVLN pour expliquer pourquoi le simple remplacement d'images en perspective n'apporte que des gains limités. Les auteurs diagnostiquent qu'une exploitation complète nécessite des modifications de la prédiction des actions, de la supervision de l'entraînement et de la représentation visuelle. Plus précisément, ils introduisent une stratégie d'exécution guidée par la confiance (CGE) pour la planification d'actions à plus long terme, construisent des routes d'entraînement avec des points de branchement fréquents, et combinent des caractéristiques sémantiques et géométriques de panoramas RGB sans ajouter de jetons visuels. Avec un squelette de 4B et une entrée RGB seule, PanoVLN dépasse l'état de l'art précédent sur R2R-CE et RxR-CE Val-Unseen.
PanoVLN dépasse l'état de l'art précédent de 11,9% et 8,7% en taux de réussite sur R2R-CE et RxR-CE Val-Unseen.
Le modèle utilise un squelette de 4B et une entrée RGB uniquement.
Des expériences dans le monde réel sur un quadruède démontrent une navigation plus rapide avec moins de pauses que les méthodes VLN antérieures.