CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 10 votes

An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

QUESTION — Comment améliorer l'efficacité d'échantillonnage et de déploiement dans la distillation en politique pour les LLM à l'aide de l'apprentissage par renforcement?

Cette étude analyse la distillation en politique (OPD) sous l'angle de l'apprentissage par renforcement, en connectant l'objectif reverse-KL à l'optimisation de politique régularisée par KL. Les auteurs présentent Least-Square Policy Distillation (LSPD), un cadre inspiré de l'apprentissage par renforcement qui intègre l'exploration optimiste et la réutilisation de données hors politique. LSPD préserve la diversité des politiques et améliore l'efficacité des déploiements en apprenant de manière répétée à partir de trajectoires collectées. Les évaluations empiriques sur six benchmarks de raisonnement mathématique montrent que LSPD obtient des gains moyens de +1.59 points en Avg@16.

LSPD obtient des gains moyens de +1.59 points en Avg@16 sur six benchmarks de raisonnement mathématique.

La formulation idéalisée de LSPD atteint une borne de regret sharp mathcal O(log K) sous exploration en ligne.

Sa variante entièrement off-policy atteint des performances comparables au OPD vanilla en utilisant seulement les 25 premiers pour cent des lots de déploiement.

DVA13304 · 28 sept. 2026 lire l'original ↗
↑