CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 14 votes

Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms

QUESTION — Pourquoi les modèles de diffusion vidéo de pointe génèrent-ils du contenu qui viole les lois physiques du monde réel ?

Ce travail étudie la cause racine des violations des lois physiques dans les modèles de diffusion vidéo en analysant leurs mécanismes d'attention internes. Les auteurs présentent une étude d'interprétabilité sur le processus de planification du mouvement, révélant que le codage de position rotatif (RoPE) induit une décroissance excessive de l'attention spatiale, ce qui amène les premières régions candidates à se bloquer dans des positions physiquement invraisemblables. Pour remédier à ce défaut, ils proposent une modification architecturale légère qui met à l'échelle la fréquence de RoPE à travers différentes étapes de débruitage.

Le codage de position rotatif (RoPE) induit une décroissance excessive de l'attention spatiale qui déclenche des modes d'échec de génération.

Une modification architecturale légère mettant à l'échelle la fréquence de RoPE à travers les étapes de débruitage améliore le bon sens physique.

paulsmith0217 · 20 sept. 2026 lire l'original ↗
↑