What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling
Les auteurs ont examiné pourquoi les WAMs latents, qui ignorent la génération future lors de l'inférence, ne parviennent pas à conserver les avantages de la généralisation malgré des performances similaires aux WAMs explicites sur des tâches in-distribution. Ils ont découvert que l'écart provient presque entièrement de la première étape de suppression du bruit, ce qui signifie que l'avantage vient de la préparation de l'avenir et non de sa génération. Pour y remédier, ils proposent Simple-WAM, qui simplifie la modélisation future en un seul passage direct de jetons vidéo entièrement bruités et adapte le calendrier du bruit. Sur des tâches de simulation et du monde réel, Simple-WAM surpasse les WAMs explicites en généralisation tout en offrant une efficacité comparable à celle des WAMs latents.
Les WAMs latents ne parviennent pas à conserver les avantages de la généralisation malgré leur correspondance avec les explicites sur les tâches in-distribution.
L'écart de performance provient presque entièrement de la première étape de suppression du bruit.
Simple-WAM surpasse les WAMs explicites en matière de généralisation avec une efficacité comparable à celle des WAMs latents.