Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
CÂU HỎI — Làm thế nào để tối ưu hóa đồng thời nhiều phần thưởng thay đổi trong quá trình học tăng cường chuyển tiếp cho mô hình khuếch tán âm thanh-video?
Bài báo đề xuất phương pháp Adaptive Reward Routing để giải quyết vấn đề định tuyến cố định và trọng số phần thưởng trong học tăng cường cho mô hình khuếch tán âm thanh-video. Phương pháp này gồm hai thành phần chính: định tuyến hướng dẫn bởi ảnh hưởng chéo đa phương tiện để cục bộ hóa cập nhật và tái trọng số nhận thức ưu tiên để điều phối phần thưởng. Các thử nghiệm cho thấy cải thiện nhất quán về chất lượng phương thức, tính nhất quán ngữ nghĩa và sự đồng bộ hóa âm thanh-video.
Cải thiện nhất quán về chất lượng phương thức, tính nhất quán ngữ nghĩa và sự đồng bộ hóa âm thanh-video so với các baseline học tăng cường mạnh.
EddieYang428 · 29 thg 9, 2026
đọc bản gốc ↗