HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
Nghiên cứu giới thiệu HarnessVLN, một framework zero-shot và training-free sử dụng một Agent Harness để điều phối nhận thức, truy xuất, grounding, điều hướng, phục hồi và kết thúc thông qua giao diện công cụ thống nhất. Hệ thống này kiểm tra các đề xuất lập kế hoạch dựa trên bằng chứng không gian và tính khả thi hình học, đồng thời duy trì một Spatiotemporal Graph để tái sử dụng bằng chứng không gian. Kết quả cho thấy HarnessVLN đạt tỷ lệ thành công 60.8%, 53.9%, 76.0% và 59.3% lần lượt trên các benchmark R2R, RxR, HM3D-v2 và HM3D-OVON, vượt qua các kết quả training-free SOTA trước đó.
HarnessVLN là một framework zero-shot và training-free tích hợp một Agent Harness điều phối qua giao diện công cụ.
Spatiotemporal Graph duy trì bằng chứng không gian tái sử dụng và ghi chú lỗi để xác minh và phục hồi.
HarnessVLN đạt tỷ lệ thành công 60.8%, 53.9%, 76.0% và 59.3% lần lượt trên các benchmark R2R, RxR, HM3D-v2 và HM3D-OVON.