On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
Ce travail évalue les rôles de la politique de déploiement, de la direction KL au niveau des tokens et du taux d'apprentissage dans la distillation de modèles strong-to-weak à travers les familles Llama3 et Qwen2.5 sur des tâches scientifiques, médicales et arithmétiques. En faisant varier indépendamment ces facteurs, les auteurs découvrent que la politique de déploiement ne joue pas nécessairement un rôle central. À la place, la direction KL au niveau des tokens détermine la performance et la couverture des sorties, tandis que le taux d'apprentissage gouverne l'oubli et la sparsité des mises à jour.
Forward KL exhibits exceptional robustness to rollout policy changes.
Reverse KL displays significantly higher sensitivity and prefers student-generated rollouts.
On-policy data improves generalisation to harder variants of the Countdown arithmetic task.