Calibrating Teacher--Student Discrepancy for On-Policy Distillation
Cet article démontre que l'écart au niveau des tokens entre un professeur et un élève lors de la distillation en ligne standard (OPD) contient des déviations provenant du professeur lui-même, qui sont apprises par l'élève. Pour résoudre ce problème, les auteurs introduisent Cal-OPD (Calibrated On-Policy Distillation), qui estime la zone d'auto-déviation du professeur à l'aide d'interventions privilégiées positives et négatives et ne conserve que la composante située au-delà de cette zone. Les expériences sur des benchmarks de raisonnement mathématique montrent que Cal-OPD surpasse systématiquement l'OPD standard à différentes échelles de modèles.
Ne conserve qu'environ 52 à 65 % de la divergence originale professeur-élève comme signal d'optimisation.
Surpasse systématiquement l'OPD standard et ses variantes à travers différentes échelles de modèles.
Évalué par le biais d'expériences sur des benchmarks de raisonnement mathématique.