CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 11 votes

Memorizon: Training World Models Beyond Their Context Window

QUESTION — Comment pouvons-nous entraîner des modèles du monde en flux continu au-delà de leur fenêtre de contexte sans encourir les coûts d'attention quadratiques sur de longues durées ?

L'article présente Memorizon, une méthode d'entraînement qui dissocie la supervision sur de longues durées de l'attention dense coûteuse pour les modèles du monde en flux. Au lieu de calculer l'attention sur tout l'historique, les segments notés récupèrent les latents top-K par co-visibilité de caméra dans une banque partagée délimitée (kK). Passer de 100 à 400 secondes n'ajoute que 12 % au temps par étape. Les expériences montrent que la récupération augmente la cohérence des revisites.

Passer de 100 à 400 secondes ajoute 12 % au temps par étape.

Par rapport à une référence de fenêtre glissante, la récupération augmente la cohérence des revisites sur chaque division.

Remplir la banque à partir d'un autre épisode réduit la corrélation de revisite de 83 %.

Luffuly · 30 sept. 2026 lire l'original ↗
↑