Think Before You Score: Thinking Reward Model for Visual Generation
Bài báo giới thiệu mô hình Thinking Reward Model (TRM) áp dụng mô hình 'Think Before You Score', trong đó xây dựng các tiêu chí thích ứng cho từng trường hợp, thực hiện đánh giá dựa trên tiêu chí và tạo ra phần thưởng điểm tỉ mỉ. Để giải quyết vấn đề phân cực điểm từ việc tối ưu hóa ưu tiên theo cặp thông thường, các tác giả đề xuất Pairwise Dual-Group Relative Policy Optimization (PD-GRPO), sử dụng sự giám sát theo cặp để cải thiện khả năng phân biệt phần thưởng mà vẫn giữ nguyên việc chấm điểm điểm số chi tiết. Các thí nghiệm trên các benchmark tạo và chỉnh sửa ảnh cho thấy TRM đạt hiệu suất vượt trội trong số các mô hình phần thưởng mã nguồn mở, đồng thời cải thiện các mô hình tạo ảnh khi dùng làm tín hiệu phần thưởng cho học tăng cường.
TRM đạt hiệu suất tối tân trong số các mô hình phần thưởng mã nguồn mở trên các benchmark tạo và chỉnh sửa hình ảnh.
Thuật toán PD-GRPO giúp cải thiện khả năng phân biệt phần thưởng đồng thời bảo toàn việc chấm điểm điểm số chi tiết.
Sử dụng TRM làm phần thưởng cho học tăng cường giúp cải thiện nhất quán các mô hình tạo sinh hình ảnh khác nhau.