CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 66 votes

VideoGen-Agent: Reinforcing Video Generation Agents

QUESTION — Comment un agent de génération de vidéo peut-il être entraîné par apprentissage par renforcement multi-tâches pour utiliser efficacement des outils externes ?

Cet article présente VideoGen-Agent, un agent multimodal entraîné par apprentissage par renforcement multi-tâches pour coordonner des outils d'augmentation, de génération et de vérification via des interactions multi-tours. L'agent subit un réglage fin supervisé sur des trajectoires générées par un professeur pour établir des comportements d'utilisation d'outils, puis un affinement par renforcement guidé par une récompense hybride sensible aux catégories. De plus, les auteurs introduisent VABench, un benchmark de 600 invites couvrant la préservation d'identité, la cohérence physique et la structure temporelle pour évaluer la qualité de génération.

Sur VABench, VideoGen-Agent surpasse son générateur de texte en vidéo de base de 19,1 points, passant de 56,5 à 75,6.

La mise à niveau des outils de génération élève encore le score à 86,1 sans entraînement supplémentaire de l'agent.

Les évaluateurs humains préfèrent la configuration mise à niveau à la référence autonome la plus forte dans 84,3 % des comparaisons.

taesiri · 21 sept. 2026 lire l'original ↗
↑