An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning
Cette étude analyse la distillation en politique (OPD) sous l'angle de l'apprentissage par renforcement, en connectant l'objectif reverse-KL à l'optimisation de politique régularisée par KL. Les auteurs présentent Least-Square Policy Distillation (LSPD), un cadre inspiré de l'apprentissage par renforcement qui intègre l'exploration optimiste et la réutilisation de données hors politique. LSPD préserve la diversité des politiques et améliore l'efficacité des déploiements en apprenant de manière répétée à partir de trajectoires collectées. Les évaluations empiriques sur six benchmarks de raisonnement mathématique montrent que LSPD obtient des gains moyens de +1.59 points en Avg@16.
LSPD obtient des gains moyens de +1.59 points en Avg@16 sur six benchmarks de raisonnement mathématique.
La formulation idéalisée de LSPD atteint une borne de regret sharp mathcal O(log K) sous exploration en ligne.
Sa variante entièrement off-policy atteint des performances comparables au OPD vanilla en utilisant seulement les 25 premiers pour cent des lots de déploiement.