Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Cet article présente Dynin-Robotics, un modèle de diffusion masquée omnimodal qui intègre la prédiction d'objectifs visuels et de dynamiques dans la génération d'actions robotiques via un modèle de trajectoire partagé. En faisant varier le conditionnement et les segments cibles, le modèle gère la prédiction d'actions, la prédiction d'observations futures et la reconstruction de trajectoires. Préentraîné en continu sur environ 1,33 million de trajectoires, le système atteint un taux de réussite moyen de 78,4 % sur un robot Franka Research 3 et accélère le décodage des actions jusqu'à 29,2x grâce à une implémentation parallèle par blocs optimisée.
Il est préentraîné en continu sur environ 1,33 million de trajectoires provenant de 48 ensembles de données Open X-Embodiment.
Il atteint un taux de réussite moyen de 78,4 % dans quatre conditions de manipulation sur un robot Franka Research 3.
Une implémentation parallèle par blocs optimisée accélère le décodage des actions jusqu'à 29,2x par rapport à l'implémentation de base.