HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
L'étude présente HarnessVLN, un cadre zero-shot sans entraînement qui utilise un Agent Harness pour coordonner la perception, la récupération, l'ancrage, la navigation, la récupération et la terminaison via une interface d'outils unifiée. Le système valide les propositions du planificateur par rapport aux preuves spatiales et à la faisabilité géométrique, tout en maintenant un graphe spatiotemporel pour réutiliser les preuves spatiales. Les résultats montrent que HarnessVLN atteint des taux de réussite de 60,8 %, 53,9 %, 76,0 % et 59,3 % sur R2R, RxR, HM3D-v2 et HM3D-OVON, respectivement, surpassant les précédents résultats de l'état de l'art sans entraînement.
HarnessVLN est un cadre zero-shot sans entraînement intégrant un Agent Harness qui se coordonne via une interface d'outils unifiée.
Un graphe spatiotemporel conserve des preuves spatiales réutilisables et des annotations d'échec pour la vérification et la récupération.
HarnessVLN atteint des taux de réussite de 60,8 %, 53,9 %, 76,0 % et 59,3 % sur R2R, RxR, HM3D-v2 et HM3D-OVON, respectivement.