CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 55 votes

LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

QUESTION — Comment unifier et stabiliser la génération vidéo multimodale native pour les flux de travail visuels des agents tout en garantissant des performances en temps réel ?

Cet article présente LynnReal-Omni, un cadre de génération vidéo multimodale native basé sur un transformateur de diffusion partagé de 32B qui unifie le texte-vidéo, le conditionnement par image et la génération longue. Il intègre également un transformateur Flash de 27B dédié au rendu en temps réel et une évaluation MSAVP de 100 prompts et 20 métriques. Sur un H100, la génération et le décodage d'une vidéo 540p de 22 images prennent 843 ms avec LynnReal-Omni et 377 ms avec Flash.

LynnReal-Omni s'appuie sur un transformateur de diffusion multimodale partagé de 32B et une variante Flash de 27B pour le rendu en temps réel.

Introduit MSAVP, une conception d'évaluation à 100 prompts et 20 métriques séparant le suivi des instructions et la qualité visuelle.

Sur un H100, la génération et le décodage d'une vidéo 540p de 22 images prennent 843 ms avec LynnReal-Omni et 377 ms avec Flash.

shaohao011 · 14 sept. 2026 lire l'original ↗
↑