VideoGen-Agent: Reinforcing Video Generation Agents
Cet article présente VideoGen-Agent, un agent multimodal entraîné par apprentissage par renforcement multi-tâches pour coordonner des outils d'augmentation, de génération et de vérification via des interactions multi-tours. L'agent subit un réglage fin supervisé sur des trajectoires générées par un professeur pour établir des comportements d'utilisation d'outils, puis un affinement par renforcement guidé par une récompense hybride sensible aux catégories. De plus, les auteurs introduisent VABench, un benchmark de 600 invites couvrant la préservation d'identité, la cohérence physique et la structure temporelle pour évaluer la qualité de génération.
Sur VABench, VideoGen-Agent surpasse son générateur de texte en vidéo de base de 19,1 points, passant de 56,5 à 75,6.
La mise à niveau des outils de génération élève encore le score à 86,1 sans entraînement supplémentaire de l'agent.
Les évaluateurs humains préfèrent la configuration mise à niveau à la référence autonome la plus forte dans 84,3 % des comparaisons.