CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 55 upvote

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

CÂU HỎI — Làm thế nào để tiến hóa chương trình phần thưởng tại thời điểm chạy nhằm tái sử dụng kỹ năng điều khiển robot hình người mà không cần huấn luyện lại?

Bài báo giới thiệu InterEvolve, một khung tiến hóa tại thời điểm chạy (test-time) cho các tác vụ điều khiển vận động và thao tác của robot hình người (humanoid loco-manipulation). Hệ thống kết hợp một mô hình nền tảng hành vi hướng đối tượng (FB model) cùng một LLM agent chịu trách nhiệm chỉnh sửa cấu trúc chương trình phần thưởng theo ngữ cảnh dựa trên phản hồi thực thi. Trình tối ưu hóa số học sẽ tinh chỉnh các hằng số đi kèm. Qua các lần lặp minh chứng trong môi trường mô phỏng song song, phương pháp giúp robot tự động khám phá và tổng hợp các kỹ năng mới, sau đó chạy tự trị trên phần cứng thực tế Unitree G1.

InterEvolve leverages an object-aware forward-backward behavioral foundation model to map rewards into loco-manipulation behaviors at test time.

An LLM agent revises the reward program structure in context using execution feedback and a skill library.

Evolved skills run autonomously on a physical Unitree G1 from egocentric onboard perception.

xusirui · 01 thg 10, 2026 đọc bản gốc ↗
↑