ViRDM: Taming Representation Distribution Matching for Few-Step Causal Video Generation
Les auteurs étudient ViRDM pour résoudre la génération vidéo causale en quelques étapes sans s'appuyer sur un réseau teacher ou critic. En associant le representation distribution matching (RDM) à une supervision stochastically truncated clean-exit, un décodeur VAE lightweight et des vector-Jacobian products étagés, la méthode surmonte les goulots d'étranglement de la mémoire. ViRDM ne nécessite que 20 generator updates pour atteindre 84.87 sur le VBench evaluation officiel, consommant 16 A100 GPU-hours tout en surpassant les baselines causales précédentes.
With only 20 generator updates, the recipe reaches 84.87 on the official VBench evaluation, outperforming the previous best few-step causal baseline by 0.36, while requiring 16 A100 GPU-hours.