Transferring the Intelligence of VLMs to Robotic Control
Nghiên cứu này khảo sát khả năng chuyển giao trí thông minh của vision-language models sang điều khiển robot thông qua RoboDawn, một giao diện trực quan cho phép VLM điều khiển robot theo vòng lặp kín bằng tập lệnh rời rạc gọn nhẹ. Tác giả kết hợp cơ chế in-context learning (ICL) với một vài chuỗi demonstration nhằm định hướng mô hình cả về thao tác giao diện lẫn chiến lược giải quyết nhiệm vụ. Kết quả thực nghiệm trên RoboTwin 2.0 C2R, RoboDojo và robot thực tế cho thấy phương pháp này đạt hiệu suất cao zero-shot và vượt trội khi áp dụng one-shot mà không cần huấn luyện robot chuyên biệt.
Trên RoboTwin 2.0 C2R, tỷ lệ thành công tăng từ 53.2% zero-shot lên 73.6% one-shot, vượt qua baseline π0.5 với 46.0%.
Trên RoboDojo, tỷ lệ thành công cải thiện từ 35.67% zero-shot lên 47.17% one-shot.
Khung làm việc này cũng chuyển giao thành công sang robot thực tế, thực hiện các tác vụ block-in-basket và block stacking trên Franka.