Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
This paper presents Dynin-Robotics, an omnimodal masked-diffusion model that integrates visual goal and dynamics prediction into robot action generation via a shared trajectory model. By varying conditioning and target spans, the model handles action prediction, action-conditioned next-observation prediction, terminal goal-state prediction, and trajectory-to-instruction reconstruction. Continually pretrained on approximately 1.33 million trajectories from 48 Open X-Embodiment datasets, the system achieves a 78.4% average success rate on a Franka Research 3 robot and accelerates model-side action decoding by up to 29.2x through an optimized block-parallel implementation.
It is continually pretrained on approximately 1.33 million trajectories from 48 Open X-Embodiment datasets.
It achieves a 78.4% average success rate across four manipulation conditions on a Franka Research 3 robot.
An optimized block-parallel implementation accelerates model-side action decoding by up to 29.2x relative to the base implementation.