AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
La génération conjointe audio-vidéo souffre de récompenses multimodales hétérogènes qui enchevêtrent les signaux d'apprentissage, et l'optimisation de deux tours de modalités est coûteuse. Pour y remédier, les auteurs proposent AV-GRPO, un cadre d'apprentissage par renforcement par diffusion en ligne ancré sur les modalités, ainsi que le jeu de données 5DAV. AV-GRPO intègre des déploiements ancrés sur les modalités, une optimisation de tour gelée verrouillée par trajectoire et des objectifs adaptatifs pour convertir l'apprentissage de préférences couplées en sous-problèmes unimodaux. Les expériences sur JavisBench et VABench démontrent de meilleures performances que LTX-2.3.
AV-GRPO surpasse LTX-2.3 en termes de qualité de génération, d'alignement sémantique et de synchronisation inter-modale sous LoRA et fine-tuning complet.