Rubric Rewards from Item Response Theory
Bài báo giới thiệu Rubric Response Theory (RRT), một phương pháp đo lường chất lượng và lựa chọn tiêu chí dựa trên item response theory khi các tiêu chí rubric là chỉ báo đơn điệu của mục tiêu chung. Thay vì cộng điểm được gán, RRT sử dụng mô hình phản hồi mặt hàng hai tham số để xử lý mẫu phán đoán làm bằng chứng về chất lượng vô hướng cụ thể cho rubric, giúp tối đa hóa tỷ lệ tín hiệu trên nhiễu cục bộ. Response Parameter Network (RPN) dự đoán độ khó và độ phân biệt của tiêu chí từ prompt và văn bản tiêu chí, đồng thời được cập nhật trực tuyến bằng online expectation maximization. Khi dùng Qwen3.5-4B làm policy, RRT đạt điểm số macro criterion cao hơn GRPO và giảm bớt số lượng yêu cầu judge.
RRT sử dụng item response model hai tham số để xử lý mẫu phán đoán thành bằng chứng chất lượng vô hướng.
Response Parameter Network dự đoán độ khó và độ phân biệt tiêu chí, được cập nhật bằng online expectation maximization.
Với Qwen3.5-4B, macro criterion score của RRT trên Medical, Science, Rubrics as Rewards Science và RubricBench cao hơn 1,7 points so với GRPO.