CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 17 upvote

Diffusion Reward Models

CÂU HỎI — Làm thế nào để mô hình phần thưởng xử lý bản chất đa phương thức của sở thích con người thay vì chỉ đưa ra ước lượng điểm đơn lẻ?

Bài báo giới thiệu DRM (Diffusion Reward Model), một mô hình phần thưởng xem việc tạo phần thưởng là bài toán ước lượng mật độ có điều kiện. Sử dụng một Diffusion Transformer nhẹ kết hợp với bộ mã hóa LLM đóng băng, DRM khử nhiễu Gaussian thành một vectơ phần thưởng, qua đó bảo toàn cấu trúc đa phương thức của dữ liệu sở thích mà không cần giả định tham số cố định. Thử nghiệm trên năm benchmark cho thấy DRM đạt hoặc vượt qua các baseline, duy trì sự cạnh tranh với các mô hình lớn hơn và mang lại hiệu suất chính sách tốt hơn trong các thí nghiệm RLHF hạ lưu.

hbx · 27 thg 9, 2026 đọc bản gốc ↗
↑