Memorizon: Training World Models Beyond Their Context Window
L'article présente Memorizon, une méthode d'entraînement qui dissocie la supervision sur de longues durées de l'attention dense coûteuse pour les modèles du monde en flux. Au lieu de calculer l'attention sur tout l'historique, les segments notés récupèrent les latents top-K par co-visibilité de caméra dans une banque partagée délimitée (kK). Passer de 100 à 400 secondes n'ajoute que 12 % au temps par étape. Les expériences montrent que la récupération augmente la cohérence des revisites.
Passer de 100 à 400 secondes ajoute 12 % au temps par étape.
Par rapport à une référence de fenêtre glissante, la récupération augmente la cohérence des revisites sur chaque division.
Remplir la banque à partir d'un autre épisode réduit la corrélation de revisite de 83 %.