CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 12 votes

MInTRL: Off-policy Intervention can boost On-policy RL

QUESTION — Comment intégrer des interventions hors-politique éparses dans l'apprentissage par renforcement en-politique pour élargir l'exploration sans provoquer de décalages de distribution importants ?

L'apprentissage par renforcement avec des récompenses vérifiables est généralement en-politique, ce qui limite l'apprentissage aux trajectoires découvertes par le modèle, tandis que les méthodes hors-politique exploitent des connaissances externes mais souffrent de décalages de distribution. Ce travail présente Minimal Intervention Reinforcement Learning (MInTRL), qui élargit l'exploration via des interventions locales et éparses dans des déploiements par ailleurs en-politique, en utilisant une politique de jugement pour remplacer les suffixes erronés par des corrections. Pendant l'entraînement, MInTRL adopte un objectif de régression d'avantage au niveau de la séquence qui élimine le besoin d'échantillonnage d'importance. Sur les benchmarks de mathématiques et de code, MInTRL surpasse les références standard.

Across math and code benchmarks, MInTRL consistently outperforms standard on-policy and off-policy baselines.

MYC081 · 11 sept. 2026 lire l'original ↗
↑