InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
Bài báo giới thiệu InterEvolve, một khung tiến hóa tại thời điểm chạy (test-time) cho các tác vụ điều khiển vận động và thao tác của robot hình người (humanoid loco-manipulation). Hệ thống kết hợp một mô hình nền tảng hành vi hướng đối tượng (FB model) cùng một LLM agent chịu trách nhiệm chỉnh sửa cấu trúc chương trình phần thưởng theo ngữ cảnh dựa trên phản hồi thực thi. Trình tối ưu hóa số học sẽ tinh chỉnh các hằng số đi kèm. Qua các lần lặp minh chứng trong môi trường mô phỏng song song, phương pháp giúp robot tự động khám phá và tổng hợp các kỹ năng mới, sau đó chạy tự trị trên phần cứng thực tế Unitree G1.
InterEvolve leverages an object-aware forward-backward behavioral foundation model to map rewards into loco-manipulation behaviors at test time.
An LLM agent revises the reward program structure in context using execution feedback and a skill library.
Evolved skills run autonomously on a physical Unitree G1 from egocentric onboard perception.