What Does Privileged Information Add to On-Policy Self-Distillation?
Cette recherche étudie la contribution de l'information privilégiée dans l'auto-distillation en ligne (OPSD) pour les grands modèles de langage. Pour isoler cette contribution, les auteurs construisent AMPLE-Math, une suite de 5 319 problèmes mathématiques avec six vues de raisonnement partageant la même réponse. Les résultats montrent que la distillation sans référence représente une grande partie de l'amélioration de Qwen3-1.7B, tandis que les preuves d'avantages de référence supplémentaires sont modestes. Les avantages dépendent de l'étudiant formé, et le remplacement de courtes sorties de réponses directes par de longues sorties de réflexion peut transformer les gains en pertes. Ces résultats suggèrent que l'OPSD améliore l'accès aux capacités de raisonnement existantes.
AMPLE-Math est une suite réutilisable de 5 319 problèmes mathématiques avec six vues de raisonnement partageant la même réponse.