In-Context Robot Learning with VLM Agents
L'article présente GPT-Policy, un cadre d'agent général pour l'apprentissage robotique en contexte utilisant un modèle de vision-langage. Le système intègre un compilateur de contexte qui préserve les transitions visuelles pertinentes pour la tâche, un VLM qui propose des actions d'outils robotiques et un contrôleur contraint qui vérifie et exécute chaque action. Des essais sur de vrais robots montrent que les démonstrations vidéo humaines améliorent l'achèvement des tâches même sans étiquettes d'action du robot, établissant une base empirique pour traduire les capacités générales des VLM en comportement physique.
GPT-Policy est un cadre intégrant un compilateur de contexte, un VLM et un contrôleur contraint pour l'apprentissage robotique en contexte.
Les démonstrations vidéo humaines améliorent l'achèvement des tâches même sans étiquettes d'action du robot lors d'essais sur de vrais robots.
Les références d'action alignées procurent des gains supplémentaires sur les tâches sensibles au contact.