CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 22 votes

In-Context Robot Learning with VLM Agents

QUESTION — Les grands modèles de vision-langage commerciaux peuvent-ils apprendre à partir de démonstrations et de retours d'interaction lors du déploiement pour traduire ces informations en un comportement robotique exécutable sans mises à jour de gradient ?

L'article présente GPT-Policy, un cadre d'agent général pour l'apprentissage robotique en contexte utilisant un modèle de vision-langage. Le système intègre un compilateur de contexte qui préserve les transitions visuelles pertinentes pour la tâche, un VLM qui propose des actions d'outils robotiques et un contrôleur contraint qui vérifie et exécute chaque action. Des essais sur de vrais robots montrent que les démonstrations vidéo humaines améliorent l'achèvement des tâches même sans étiquettes d'action du robot, établissant une base empirique pour traduire les capacités générales des VLM en comportement physique.

GPT-Policy est un cadre intégrant un compilateur de contexte, un VLM et un contrôleur contraint pour l'apprentissage robotique en contexte.

Les démonstrations vidéo humaines améliorent l'achèvement des tâches même sans étiquettes d'action du robot lors d'essais sur de vrais robots.

Les références d'action alignées procurent des gains supplémentaires sur les tâches sensibles au contact.

thewhole · 16 sept. 2026 lire l'original ↗
↑