Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
L'article propose Adaptive Reward Routing pour remédier aux limites du routage fixe et des poids de récompense dans l'apprentissage par renforcement pour les modèles de diffusion audio-vidéo conjoints. La méthode comprend un routage guidé par l'influence intermodale pour localiser les mises à jour et une pondération consciente des modalités préservant les préférences pour coordonner les récompenses. Les expériences démontrent des améliorations constantes de la qualité des modalités, de la cohérence sémantique et de la synchronisation audio-vidéo.
Des expériences approfondies démontrent des améliorations constantes de la qualité des modalités, de la cohérence sémantique et de la synchronisation audio-vidéo par rapport aux bases de référence d'apprentissage par renforcement.