In-Context Robot Learning with VLM Agents
Bài báo giới thiệu GPT-Policy, một framework tổng quát cho in-context robot learning sử dụng vision-language model. Hệ thống bao gồm một trình biên dịch ngữ cảnh (context compiler) giữ lại các chuyển đổi trực quan liên quan đến tác vụ, một VLM đề xuất hành động và một bộ điều khiển có ràng buộc để xác minh và thực thi từng hành động. Các thử nghiệm thực tế cho thấy các bản demo video từ con người giúp cải thiện khả năng hoàn thành tác vụ ngay cả khi không có nhãn hành động của robot, đặt nền tảng thực nghiệm cho việc chuyển đổi khả năng tổng quát của VLM thành hành vi vật lý.
GPT-Policy là framework tích hợp context compiler, VLM và constrained controller cho in-context robot learning.
Các bản demo video từ con người cải thiện hoàn thành tác vụ ngay cả khi không có nhãn hành động của robot trong các thử nghiệm thực tế.
aligned action references mang lại các lợi ích bổ sung trên các tác vụ nhạy cảm với lực tiếp xúc (contact-sensitive tasks).