CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 49 votes

Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

QUESTION — Comment un mécanisme d'attention hybride combinant Softmax local et mémoire linéaire bidirectionnelle peut-il accélérer la génération de vidéos en direct tout en préservant la qualité ?

Les auteurs présentent Video DeltaNet (VDN), une architecture d'attention hybride conçue pour atténuer les goulets d'étranglement informatiques dans les modèles de diffusion vidéo. La branche linéaire de VDN introduit la Video Delta Attention pour mettre à jour la mémoire par trame à l'aide de jetons spatiaux, tout en conservant l'attention Softmax pour les interactions textuelles et audio. En utilisant une recette d'alignement enseignant par étapes, une distillation en huit étapes et une pile de service SGLang optimisée, VDN-H3 complète efficacement le débruitage de flux vidéo haute résolution sur plusieurs GPU NVIDIA B200.

VDN-H3 réalise le débruitage DiT pour une vidéo 768p de 14.3 secondes en 6.70 secondes sur huit GPU NVIDIA B200.

L'approche réalise une accélération de 14.5x par rapport à la référence dense H3 à 50 étapes sur le même nombre de GPU.

L'architecture applique une distillation en huit étapes combinée à une pile de service SGLang optimisée.

taesiri · 17 sept. 2026 lire l'original ↗
↑