CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 13 votes

Calibrating Teacher--Student Discrepancy for On-Policy Distillation

QUESTION — Comment éliminer les déviations propres au professeur lors de la distillation en ligne (on-policy) pour améliorer l'entraînement des modèles de raisonnement ?

Cet article démontre que l'écart au niveau des tokens entre un professeur et un élève lors de la distillation en ligne standard (OPD) contient des déviations provenant du professeur lui-même, qui sont apprises par l'élève. Pour résoudre ce problème, les auteurs introduisent Cal-OPD (Calibrated On-Policy Distillation), qui estime la zone d'auto-déviation du professeur à l'aide d'interventions privilégiées positives et négatives et ne conserve que la composante située au-delà de cette zone. Les expériences sur des benchmarks de raisonnement mathématique montrent que Cal-OPD surpasse systématiquement l'OPD standard à différentes échelles de modèles.

Ne conserve qu'environ 52 à 65 % de la divergence originale professeur-élève comme signal d'optimisation.

Surpasse systématiquement l'OPD standard et ses variantes à travers différentes échelles de modèles.

Évalué par le biais d'expériences sur des benchmarks de raisonnement mathématique.

qqiang · 18 sept. 2026 lire l'original ↗
↑