CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 148 votes

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

QUESTION — Comment maintenir la cohérence à long horizon et la précision du contrôle de la caméra dans les modèles du monde vidéo ?

Les auteurs présentent WorldCrafter, un modèle du monde vidéo intégrant une mémoire implicite consciente de la 3D et interrogeable par caméra pour gérer les observations à long horizon. Le système utilise un encodeur de mémoire et un module de lecture conditionné par la pose pour agréger les observations historiques en jetons cibles fixes avant le débruitage. En combinant cette mémoire avec un contexte temporel et une distillation en quelques étapes, le modèle permet l'exploration de scènes en flux continu à partir d'une seule image d'entrée ou d'une invite textuelle.

WorldCrafter apprend une mémoire implicite consciente de la 3D interrogeable par caméra pour améliorer la cohérence à long horizon.

Drexubery · 21 sept. 2026 lire l'original ↗
↑