CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 116 votes

Transferring the Intelligence of VLMs to Robotic Control

QUESTION — L'intelligence des modèles vision-langage peut-elle se généraliser du monde numérique au monde physique pour le contrôle de robots ?

Cet article étudie si l'intelligence des modèles vision-langage peut se transférer du contrôle numérique au contrôle robotique physique via RoboDawn, une interface intuitive permettant un contrôle VLM en boucle fermée par des commandes discrètes compactes. Les auteurs introduisent un schéma d'apprentissage en contexte utilisant quelques démonstrations pour ancrer le VLM dans l'utilisation de l'interface et les stratégies de tâches. Des expériences sur RoboTwin 2.0 C2R, RoboDojo et des robots réels montrent que le cadre atteint de solides performances en zéro-shot et des gains substantiels en one-shot sans entraînement robotique spécifique.

Sur RoboTwin 2.0 C2R, le taux de réussite passe de 53,2 % en zero-shot à 73,6 % en one-shot, dépassant la base de référence solide π0,5 (46,0 %).

Des gains similaires sont observés sur RoboDojo, où le taux de réussite s'améliore de 35,67 % en zero-shot à 47,17 % en one-shot.

Le même cadre se transfère également à des robots du monde réel, réalisant des tâches de placement de blocs et d'empilement sur Franka.

MenghaoGuo · 19 sept. 2026 lire l'original ↗
↑