CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 42 upvote

Think Before You Score: Thinking Reward Model for Visual Generation

CÂU HỎI — Làm thế nào để cải thiện các mô hình phần thưởng hình ảnh bằng cách đánh giá tường minh thay vì chỉ ánh xạ trực tiếp thành phần thưởng vô hướng?

Bài báo giới thiệu mô hình Thinking Reward Model (TRM) áp dụng mô hình 'Think Before You Score', trong đó xây dựng các tiêu chí thích ứng cho từng trường hợp, thực hiện đánh giá dựa trên tiêu chí và tạo ra phần thưởng điểm tỉ mỉ. Để giải quyết vấn đề phân cực điểm từ việc tối ưu hóa ưu tiên theo cặp thông thường, các tác giả đề xuất Pairwise Dual-Group Relative Policy Optimization (PD-GRPO), sử dụng sự giám sát theo cặp để cải thiện khả năng phân biệt phần thưởng mà vẫn giữ nguyên việc chấm điểm điểm số chi tiết. Các thí nghiệm trên các benchmark tạo và chỉnh sửa ảnh cho thấy TRM đạt hiệu suất vượt trội trong số các mô hình phần thưởng mã nguồn mở, đồng thời cải thiện các mô hình tạo ảnh khi dùng làm tín hiệu phần thưởng cho học tăng cường.

TRM đạt hiệu suất tối tân trong số các mô hình phần thưởng mã nguồn mở trên các benchmark tạo và chỉnh sửa hình ảnh.

Thuật toán PD-GRPO giúp cải thiện khả năng phân biệt phần thưởng đồng thời bảo toàn việc chấm điểm điểm số chi tiết.

Sử dụng TRM làm phần thưởng cho học tăng cường giúp cải thiện nhất quán các mô hình tạo sinh hình ảnh khác nhau.

DogNeverSleep · 29 thg 9, 2026 đọc bản gốc ↗
↑