CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 8 votes

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

QUESTION — Comment la prédiction d'objectifs visuels et de dynamiques peut-elle être intégrée dans la génération d'actions robotiques via un modèle de trajectoire partagé ?

Cet article présente Dynin-Robotics, un modèle de diffusion masquée omnimodal qui intègre la prédiction d'objectifs visuels et de dynamiques dans la génération d'actions robotiques via un modèle de trajectoire partagé. En faisant varier le conditionnement et les segments cibles, le modèle gère la prédiction d'actions, la prédiction d'observations futures et la reconstruction de trajectoires. Préentraîné en continu sur environ 1,33 million de trajectoires, le système atteint un taux de réussite moyen de 78,4 % sur un robot Franka Research 3 et accélère le décodage des actions jusqu'à 29,2x grâce à une implémentation parallèle par blocs optimisée.

Il est préentraîné en continu sur environ 1,33 million de trajectoires provenant de 48 ensembles de données Open X-Embodiment.

Il atteint un taux de réussite moyen de 78,4 % dans quatre conditions de manipulation sur un robot Franka Research 3.

Une implémentation parallèle par blocs optimisée accélère le décodage des actions jusqu'à 29,2x par rapport à l'implémentation de base.

leehe228 · 11 sept. 2026 lire l'original ↗
↑