Rubric Rewards from Item Response Theory
L'article présente la Rubric Response Theory (RRT), qui mesure la qualité et sélectionne des critères à l'aide de la théorie de la réponse aux items lorsque les critères de grille sont des indicateurs monotones d'une cible partagée. Au lieu d'additionner des points attribués, la RRT utilise un modèle de réponse aux items à deux paramètres traitant les motifs de verdict comme des preuves de la qualité scalaire propre à la grille, maximisant le rapport signal sur bruit local. Un Response Parameter Network (RPN) prédit la difficulté et la discrimination des critères à partir du texte du prompt et des critères, mis à jour via l'espérance-maximisation en ligne. Utilisant Qwen3.5-4B comme politique, la RRT atteint des scores de critères macro supérieurs à GRPO tout en réduisant les requêtes de juge.
La RRT utilise un modèle de réponse aux items à deux paramètres qui traite le modèle de verdict comme une preuve de la qualité scalaire propre à la grille.
Un Response Parameter Network prédit la difficulté et la discrimination des critères, mis à jour via l'espérance-maximisation en ligne.
Avec Qwen3.5-4B comme politique, le score de critère macro de la RRT sur Medical, Science, Rubrics as Rewards Science et RubricBench est supérieur de 1,7 points à celui de l'optimisation de politique relative de groupe (GRPO).