MInTRL: Off-policy Intervention can boost On-policy RL
L'apprentissage par renforcement avec des récompenses vérifiables est généralement en-politique, ce qui limite l'apprentissage aux trajectoires découvertes par le modèle, tandis que les méthodes hors-politique exploitent des connaissances externes mais souffrent de décalages de distribution. Ce travail présente Minimal Intervention Reinforcement Learning (MInTRL), qui élargit l'exploration via des interventions locales et éparses dans des déploiements par ailleurs en-politique, en utilisant une politique de jugement pour remplacer les suffixes erronés par des corrections. Pendant l'entraînement, MInTRL adopte un objectif de régression d'avantage au niveau de la séquence qui élimine le besoin d'échantillonnage d'importance. Sur les benchmarks de mathématiques et de code, MInTRL surpasse les références standard.
Across math and code benchmarks, MInTRL consistently outperforms standard on-policy and off-policy baselines.