CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 17 votes

StoryEngine: A State-Grounded Agentic Framework for Video Storytelling

QUESTION — Comment les frameworks de génération de vidéo par agents peuvent-ils maintenir une cohérence visuelle et narrative à long terme sur plusieurs plans ?

L'article propose StoryEngine, un framework d'agents ancré dans l'état, conçu pour résoudre la dérive visuelle et l'incohérence narrative dans la génération de vidéos multi-plans. StoryEngine sépare les plans sémantiques autoritaires des observations visuelles peu fiables en maintenant une représentation structurée des états des entités et en propageant les changements d'événements. Une boucle de correction guidée par l'évaluation corrige les incohérences locales, garantissant le maintien de la progression narrative causale d'un plan à l'autre.

StoryEngine establishes a separation between authoritative semantic plans and unreliable visual observations.

A bounded evaluation-guided repair loop further corrects local state inconsistencies.

StoryEngine consistently outperforms state-of-the-art methods across all evaluation dimensions for video storytelling.

yeyingjin · 27 sept. 2026 lire l'original ↗
↑