CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 52 votes

What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling

QUESTION — Pouvons-nous supprimer la génération vidéo complète lors de l'inférence dans les modèles d'action du monde sans perdre leurs avantages de généralisation ?

Les auteurs ont examiné pourquoi les WAMs latents, qui ignorent la génération future lors de l'inférence, ne parviennent pas à conserver les avantages de la généralisation malgré des performances similaires aux WAMs explicites sur des tâches in-distribution. Ils ont découvert que l'écart provient presque entièrement de la première étape de suppression du bruit, ce qui signifie que l'avantage vient de la préparation de l'avenir et non de sa génération. Pour y remédier, ils proposent Simple-WAM, qui simplifie la modélisation future en un seul passage direct de jetons vidéo entièrement bruités et adapte le calendrier du bruit. Sur des tâches de simulation et du monde réel, Simple-WAM surpasse les WAMs explicites en généralisation tout en offrant une efficacité comparable à celle des WAMs latents.

Les WAMs latents ne parviennent pas à conserver les avantages de la généralisation malgré leur correspondance avec les explicites sur les tâches in-distribution.

L'écart de performance provient presque entièrement de la première étape de suppression du bruit.

Simple-WAM surpasse les WAMs explicites en matière de généralisation avec une efficacité comparable à celle des WAMs latents.

rpzhou · 29 sept. 2026 lire l'original ↗
↑