Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
Ce travail aborde la limitation des budgets de déploiement finis dans le Reinforcement Learning with Verifiable Rewards (RLVR), qui produisent fréquemment des groupes d'échec total dépourvus de signaux de gradient de politique. Les auteurs proposent GRAFT (Gated Replacement of Answer-Failed groups with peer Trajectories), un cadre conscient du hors-politique qui remplace les groupes d'échec par des groupes pairs informatifs issus de modèles hétérogènes. En contrôlant l'incompatibilité inter-modèles grâce à une pondération de compatibilité au niveau de la séquence et à un écrêtage du ratio d'importance au niveau des tokens, GRAFT permet un apprentissage mutuel sans enseignant désigné plus fort.
À travers trois paires de modèles hétérogènes et cinq benchmarks de raisonnement mathématique, GRAFT améliore systématiquement les deux modèles par rapport à GRPO avec le même budget de déploiement, gagnant 2,1 points en moyenne et jusqu'à 4,5 points de performance moyenne au niveau du modèle.
Les trajectoires de pairs stockées préservent la plupart des gains, s'améliorant par rapport à GRPO de 1,8 points en moyenne sans co-entraînement simultané.