CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 63 votes

MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation

QUESTION — Un modèle vision-langage généraliste peut-il faire fonctionner un robot directement à partir d'observations sans s'appuyer sur des experts d'action externes?

L'article présente MotorMind, un harnais de manipulation robotique qui relie les actions de niveau intermédiaire proposées par un VLM à un contrôle robotique déterministe. Fonctionnant sans entraînement de politique spécifique à une tâche ni outils de mise à la terre comme SAM3, MotorMind permet à un VLM généraliste d'effectuer des manipulations robotiques zero-shot directement à partir d'observations visuelles. Les expériences démontrent des gains de performance significatifs par rapport aux bases de référence zero-shot sur les suites LIBERO-PRO et des configurations de robots xArm6 réels.

MotorMind atteint un taux de réussite de 66,7% sur les suites LIBERO-PRO de base et de 53,8% sous perturbations.

La même interface atteint 95% de réussite moyenne sur un véritable robot xArm6 dans les contextes de manipulation directe et de perturbation humaine.

bx6d · 29 sept. 2026 lire l'original ↗
↑