CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 13 upvote

Rubric Rewards from Item Response Theory

CÂU HỎI — Rubric Response Theory (RRT) giải quyết bài toán tổng hợp phần thưởng rubric trong reinforcement learning ra sao?

Bài báo giới thiệu Rubric Response Theory (RRT), một phương pháp đo lường chất lượng và lựa chọn tiêu chí dựa trên item response theory khi các tiêu chí rubric là chỉ báo đơn điệu của mục tiêu chung. Thay vì cộng điểm được gán, RRT sử dụng mô hình phản hồi mặt hàng hai tham số để xử lý mẫu phán đoán làm bằng chứng về chất lượng vô hướng cụ thể cho rubric, giúp tối đa hóa tỷ lệ tín hiệu trên nhiễu cục bộ. Response Parameter Network (RPN) dự đoán độ khó và độ phân biệt của tiêu chí từ prompt và văn bản tiêu chí, đồng thời được cập nhật trực tuyến bằng online expectation maximization. Khi dùng Qwen3.5-4B làm policy, RRT đạt điểm số macro criterion cao hơn GRPO và giảm bớt số lượng yêu cầu judge.

RRT sử dụng item response model hai tham số để xử lý mẫu phán đoán thành bằng chứng chất lượng vô hướng.

Response Parameter Network dự đoán độ khó và độ phân biệt tiêu chí, được cập nhật bằng online expectation maximization.

Với Qwen3.5-4B, macro criterion score của RRT trên Medical, Science, Rubrics as Rewards Science và RubricBench cao hơn 1,7 points so với GRPO.

Miladyz · 28 thg 9, 2026 đọc bản gốc ↗
↑