CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 123 votes

Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL

QUESTION — Comment optimiser conjointement des récompenses concurrentes et évolutives lors de l'apprentissage par renforcement par processus direct pour les modèles de diffusion audio-vidéo ?

L'article propose Adaptive Reward Routing pour remédier aux limites du routage fixe et des poids de récompense dans l'apprentissage par renforcement pour les modèles de diffusion audio-vidéo conjoints. La méthode comprend un routage guidé par l'influence intermodale pour localiser les mises à jour et une pondération consciente des modalités préservant les préférences pour coordonner les récompenses. Les expériences démontrent des améliorations constantes de la qualité des modalités, de la cohérence sémantique et de la synchronisation audio-vidéo.

Des expériences approfondies démontrent des améliorations constantes de la qualité des modalités, de la cohérence sémantique et de la synchronisation audio-vidéo par rapport aux bases de référence d'apprentissage par renforcement.

EddieYang428 · 29 sept. 2026 lire l'original ↗
↑