CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 55 votes

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

QUESTION — Comment faire évoluer les programmes de récompense au moment de l'exécution pour réutiliser les compétences de contrôle de robots humanoïdes sans réentraînement ?

Cet article présente InterEvolve, un cadre d'évolution au moment de l'exécution pour la locomotion et la manipulation humanoïdes. Le système combine un modèle de fondation comportemental orienté objet avec un agent LLM qui révise la structure des programmes de récompense en contexte en fonction des retours d'exécution, tandis qu'un optimisateur numérique ajuste les constantes. Évaluée à travers des scénarios de simulation parallèles, cette approche permet au système de découvrir et de composer des compétences motrices de manière itérative.

InterEvolve leverages an object-aware forward-backward behavioral foundation model to map rewards into loco-manipulation behaviors at test time.

An LLM agent revises the reward program structure in context using execution feedback and a skill library.

Evolved skills run autonomously on a physical Unitree G1 from egocentric onboard perception.

xusirui · 01 oct. 2026 lire l'original ↗
↑