CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 5 votes

AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

QUESTION — Comment résoudre l'enchevêtrement des signaux d'apprentissage dans l'optimisation par renforcement pour la génération conjointe audio-vidéo ?

La génération conjointe audio-vidéo souffre de récompenses multimodales hétérogènes qui enchevêtrent les signaux d'apprentissage, et l'optimisation de deux tours de modalités est coûteuse. Pour y remédier, les auteurs proposent AV-GRPO, un cadre d'apprentissage par renforcement par diffusion en ligne ancré sur les modalités, ainsi que le jeu de données 5DAV. AV-GRPO intègre des déploiements ancrés sur les modalités, une optimisation de tour gelée verrouillée par trajectoire et des objectifs adaptatifs pour convertir l'apprentissage de préférences couplées en sous-problèmes unimodaux. Les expériences sur JavisBench et VABench démontrent de meilleures performances que LTX-2.3.

AV-GRPO surpasse LTX-2.3 en termes de qualité de génération, d'alignement sémantique et de synchronisation inter-modale sous LoRA et fine-tuning complet.

Dr-Loser · 24 sept. 2026 lire l'original ↗
↑