CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 5 upvote

AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

CÂU HỎI — Làm thế nào để giải quyết vấn đề tín hiệu học tập bị lẫn lộn trong tối ưu hóa reinforcement learning cho việc sinh đồng thời âm thanh và video?

Việc sinh đồng thời âm thanh và video gặp khó khăn do phần thưởng đa phương thức dị thể làm lẫn lộn tín hiệu học tập và việc tối ưu hóa hai tháp mô hình tốn kém chi phí tính toán. Để giải quyết, nghiên cứu đề xuất AV-GRPO, một framework diffusion RL trực tuyến được neo theo phương thức, cùng với bộ dữ liệu 5DAV. AV-GRPO áp dụng các mô-đun gồm triển khai neo theo phương thức, tối ưu hóa tháp đóng băng khóa quỹ đạo, và các mục tiêu thích ứng để chuyển đổi bài toán học ưu tiên đa phương thức thành các bài toán phụ đơn phương thức. Kết quả thực nghiệm trên JavisBench và VABench chứng minh phương pháp này vượt trội hơn LTX-2.3.

AV-GRPO vượt trội hơn LTX-2.3 về chất lượng sinh, căn chỉnh ngữ nghĩa và đồng bộ hóa chéo phương thức dưới dạng LoRA và fine-tuning toàn phần.

Dr-Loser · 24 thg 9, 2026 đọc bản gốc ↗
↑