CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 22 upvote

In-Context Robot Learning with VLM Agents

CÂU HỎI — Liệu các vision-language model thương mại có thể học hỏi từ các minh họa và phản hồi tương tác khi triển khai để chuyển đổi thành hành vi robot có thể thực thi mà không cần cập nhật gradient?

Bài báo giới thiệu GPT-Policy, một framework tổng quát cho in-context robot learning sử dụng vision-language model. Hệ thống bao gồm một trình biên dịch ngữ cảnh (context compiler) giữ lại các chuyển đổi trực quan liên quan đến tác vụ, một VLM đề xuất hành động và một bộ điều khiển có ràng buộc để xác minh và thực thi từng hành động. Các thử nghiệm thực tế cho thấy các bản demo video từ con người giúp cải thiện khả năng hoàn thành tác vụ ngay cả khi không có nhãn hành động của robot, đặt nền tảng thực nghiệm cho việc chuyển đổi khả năng tổng quát của VLM thành hành vi vật lý.

GPT-Policy là framework tích hợp context compiler, VLM và constrained controller cho in-context robot learning.

Các bản demo video từ con người cải thiện hoàn thành tác vụ ngay cả khi không có nhãn hành động của robot trong các thử nghiệm thực tế.

aligned action references mang lại các lợi ích bổ sung trên các tác vụ nhạy cảm với lực tiếp xúc (contact-sensitive tasks).

thewhole · 16 thg 9, 2026 đọc bản gốc ↗
↑