RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
Les agents multi-tours entraînés par apprentissage par renforcement utilisent souvent la distillation sur politique (OPD) avec un professeur privilégié pour une supervision dense des jetons, mais les informations privilégiées ne sont pas toujours fiables et les avantages du professeur dépendent des étapes. Nous proposons RetireOPD (Self-Retiring On-Policy Distillation), optimisant un professeur découplé avec des récompenses environnementales et entraînant un étudiant conjointement avec RL et OPD. Grâce à la retraite adaptative, l'étudiant abandonne le professeur une fois que l'écart cesse de diminuer et atteint un taux de réussite cible, poursuivant avec RL seul. Sur les modèles Qwen2.5 de 1.5B à 7B, RetireOPD améliore le taux de réussite ALFWorld de 14,1% à 18,8% et la précision WebShop de 11,8% à 19,0%.
RetireOPD adopte la retraite adaptative où l'étudiant abandonne le professeur une fois que l'écart cesse de diminuer et atteint un taux de réussite cible.
Il améliore le taux de réussite ALFWorld par rapport à la base de référence RL de 14,1% à 18,8% sur les modèles Qwen2.5 de 1.5B à 7B.
La précision WebShop s'améliore de 11,8% à 19,0%, surpassant son propre professeur conditionné aux compétences dans tous les contextes.