PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation
Công trình này khảo sát việc điều hướng thị giác-ngôn ngữ (VLN) bằng các quan sát toàn cảnh và giới thiệu PanoVLN để khắc phục việc thay thế ảnh phối cảnh đơn thuần mang lại ít lợi ích. Các tác giả nhận định rằng việc khai thác tầm nhìn rộng hơn đòi hỏi phải sửa đổi việc dự đoán hành động, giám sát huấn luyện và biểu diễn trực quan. Cụ thể, họ giới thiệu chiến lược confidence-guided execution (CGE) để lập kế hoạch hành động dài hạn hơn, xây dựng các tuyến đường huấn luyện có điểm rẽ thường xuyên, đồng thời kết hợp các đặc trưng ngữ nghĩa và hình học từ ảnh toàn cảnh RGB mà không làm tăng số lượng token thị giác. Với backbone 4B và đầu vào chỉ gồm RGB, PanoVLN vượt qua SOTA trước đó trên R2R-CE và RxR-CE Val-Unseen, đồng thời thể hiện khả năng điều hướng nhanh hơn trong các thí nghiệm thực tế.
PanoVLN vượt qua SOTA trước đó 11,9% và 8,7% về tỷ lệ thành công trên R2R-CE và RxR-CE Val-Unseen.
Mô hình sử dụng backbone 4B và đầu vào chỉ gồm RGB.
Thí nghiệm thực tế trên robot bốn chân chứng minh khả năng điều hướng nhanh hơn với ít điểm dừng hơn các phương pháp VLN trước đó.