Modality-Autoregressive World-Action Models
L'article présente ModAR, un modèle monde-action (WAM) qui débruite de manière autorégressive plusieurs modalités futures avant de prédire des actions. Grâce à un entraînement à partir de zéro et à l'évaluation de divers mélanges de données, les auteurs découvrent que la prédiction de point tracks, de features DINO et de depth maps offre des avantages marqués, tandis que la prédiction du RGB seul n'apporte pas de gains constants. ModAR surpasse les formulations WAM existantes en taux de réussite moyen. Fin Tuné à partir de Flex-$\pi$, ModAR atteint un taux de réussite moyen légèrement supérieur tout en utilisant environ 20 fois moins de training FLOPs et sans pré-entraînement.
ModAR atteint le taux de réussite moyen le plus élevé à toutes les échelles de données évaluées par rapport aux formulations WAM existantes.
ModAR atteint un taux de réussite moyen observé légèrement supérieur (75% vs 72%) par rapport à Flex-$\pi$.
ModAR utilise environ 20times moins de training FLOPs et aucun pré-entraînement par rapport à Flex-$\pi$.