World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal
Ce travail présente World Action Agent (WAA), un harnais multi-agents permettant aux modèles vision-langage (VLM) de piloter des robots au sein d'un espace de travail d'action visuelle comprenant des vues de contact, une répétition d'action et une correction en vue. WAA fait évoluer des compétences multimodales à partir de démonstrations d'experts et utilise des traces d'interaction pour affiner de plus petits VLM. Évalué sur LIBERO-Pro, WAA atteint un taux de réussite moyen de pointe en utilisant des compétences issues de LIBERO-90, tout en restant efficace sur robosuite sans apprentissage supplémentaire.
Sur LIBERO-Pro, WAA avec des compétences évoluées uniquement à partir de LIBERO-90 atteint un succès moyen de pointe de 75,6 %, surpassant les VLA de bout en bout, les agents code-as-policy et une base de référence visuelle avec le même squelette.
Le fine-tuning de Qwen3.5-9B sur les traces du harnais fait passer son taux de succès hors domaine de 1,7 % à 43,3 %.