CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 49 upvote

PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation

CÂU HỎI — Làm thế nào để khai thác hiệu quả các quan sát toàn cảnh trong các tác vụ điều hướng thị giác-ngôn ngữ?

Công trình này khảo sát việc điều hướng thị giác-ngôn ngữ (VLN) bằng các quan sát toàn cảnh và giới thiệu PanoVLN để khắc phục việc thay thế ảnh phối cảnh đơn thuần mang lại ít lợi ích. Các tác giả nhận định rằng việc khai thác tầm nhìn rộng hơn đòi hỏi phải sửa đổi việc dự đoán hành động, giám sát huấn luyện và biểu diễn trực quan. Cụ thể, họ giới thiệu chiến lược confidence-guided execution (CGE) để lập kế hoạch hành động dài hạn hơn, xây dựng các tuyến đường huấn luyện có điểm rẽ thường xuyên, đồng thời kết hợp các đặc trưng ngữ nghĩa và hình học từ ảnh toàn cảnh RGB mà không làm tăng số lượng token thị giác. Với backbone 4B và đầu vào chỉ gồm RGB, PanoVLN vượt qua SOTA trước đó trên R2R-CE và RxR-CE Val-Unseen, đồng thời thể hiện khả năng điều hướng nhanh hơn trong các thí nghiệm thực tế.

PanoVLN vượt qua SOTA trước đó 11,9% và 8,7% về tỷ lệ thành công trên R2R-CE và RxR-CE Val-Unseen.

Mô hình sử dụng backbone 4B và đầu vào chỉ gồm RGB.

Thí nghiệm thực tế trên robot bốn chân chứng minh khả năng điều hướng nhanh hơn với ít điểm dừng hơn các phương pháp VLN trước đó.

xichenhku · 28 thg 9, 2026 đọc bản gốc ↗
↑