LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
Cet article présente LynnReal-Omni, un cadre de génération vidéo multimodale native basé sur un transformateur de diffusion partagé de 32B qui unifie le texte-vidéo, le conditionnement par image et la génération longue. Il intègre également un transformateur Flash de 27B dédié au rendu en temps réel et une évaluation MSAVP de 100 prompts et 20 métriques. Sur un H100, la génération et le décodage d'une vidéo 540p de 22 images prennent 843 ms avec LynnReal-Omni et 377 ms avec Flash.
LynnReal-Omni s'appuie sur un transformateur de diffusion multimodale partagé de 32B et une variante Flash de 27B pour le rendu en temps réel.
Introduit MSAVP, une conception d'évaluation à 100 prompts et 20 métriques séparant le suivi des instructions et la qualité visuelle.
Sur un H100, la génération et le décodage d'une vidéo 540p de 22 images prennent 843 ms avec LynnReal-Omni et 377 ms avec Flash.