CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 11 votes

Modality-Autoregressive World-Action Models

QUESTION — Comment combiner efficacement plusieurs modalités visuelles dans les modèles mondes-actions plutôt que de prédire uniquement le RGB ?

L'article présente ModAR, un modèle monde-action (WAM) qui débruite de manière autorégressive plusieurs modalités futures avant de prédire des actions. Grâce à un entraînement à partir de zéro et à l'évaluation de divers mélanges de données, les auteurs découvrent que la prédiction de point tracks, de features DINO et de depth maps offre des avantages marqués, tandis que la prédiction du RGB seul n'apporte pas de gains constants. ModAR surpasse les formulations WAM existantes en taux de réussite moyen. Fin Tuné à partir de Flex-$\pi$, ModAR atteint un taux de réussite moyen légèrement supérieur tout en utilisant environ 20 fois moins de training FLOPs et sans pré-entraînement.

ModAR atteint le taux de réussite moyen le plus élevé à toutes les échelles de données évaluées par rapport aux formulations WAM existantes.

ModAR atteint un taux de réussite moyen observé légèrement supérieur (75% vs 72%) par rapport à Flex-$\pi$.

ModAR utilise environ 20times moins de training FLOPs et aucun pré-entraînement par rapport à Flex-$\pi$.

taesiri · 15 sept. 2026 lire l'original ↗
↑