Training Object Permanence in World Models
QUESTION — Les modèles de génération vidéo possèdent-ils une permanence de l'objet intrinsèque, et l'entraînement sur un jeu de données inspiré de la science cognitive peut-il l'inculquer ?
Les auteurs présentent WROP, une infrastructure de données de 150 tâches inspirées des sciences cognitives produisant un corpus d'entraînement de 1,5 million d'échantillons et un examen de 300 questions pour évaluer 14 modèles vidéo. Ils construisent PWM-WROP, un modèle du monde de 16B paramètres entraîné sur une pile PyTorch native sur AWS Trainium2. Dans une évaluation Elo en aveugle, PWM-WROP se classe premier parmi les modèles de continuation et troisième au total.
WROP comprend 150 tâches conçues à la main divisées en six catégories cognitives.
Le corpus d'entraînement contient 1,5M d'échantillons et l'examen comporte 300 questions.
PWM-WROP est un modèle du monde de 16B se classant premier parmi les modèles de continuation.
Hokin · 23 sept. 2026
lire l'original ↗