InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
Cet article présente InterEvolve, un cadre d'évolution au moment de l'exécution pour la locomotion et la manipulation humanoïdes. Le système combine un modèle de fondation comportemental orienté objet avec un agent LLM qui révise la structure des programmes de récompense en contexte en fonction des retours d'exécution, tandis qu'un optimisateur numérique ajuste les constantes. Évaluée à travers des scénarios de simulation parallèles, cette approche permet au système de découvrir et de composer des compétences motrices de manière itérative.
InterEvolve leverages an object-aware forward-backward behavioral foundation model to map rewards into loco-manipulation behaviors at test time.
An LLM agent revises the reward program structure in context using execution feedback and a skill library.
Evolved skills run autonomously on a physical Unitree G1 from egocentric onboard perception.