CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 221 votes

Scaling Properties of Same-Family On-Policy Distillation

QUESTION — Quelles sont les propriétés de mise à l'échelle de la distillation en politique (on-policy) à travers différentes configurations weak-to-strong, same-base et strong-to-weak ?

Cet article étudie les propriétés de mise à l'échelle de la distillation en politique (on-policy distillation ou OPD) dans des configurations weak-to-strong, same-base et strong-to-weak. Les auteurs démontrent que la dynamique d'entraînement initiale de l'OPD présente un régime de transfert utile où la précision retenue augmente linéairement avec la racine carrée de la divergence KL inverse au niveau des tokens. Notamment, dans chaque paire weak-to-strong observée, le score du student dépasse celui de son teacher. En ajustant des lois de puissance, l'étude montre que les teacher plus petits avec des scores équivalents transfèrent mieux les compétences.

La précision retenue augmente approximativement de manière linéaire avec la racine carrée de la divergence KL inverse au niveau des tokens pendant le régime de transfert utile.

Dans chaque paire weak-to-strong observée, le score d'or maximal du student dépasse celui de son teacher.

Le score d'or maximal s'améliore avec l'échelle du teacher uniquement jusqu'à environ l'échelle du student.

colored-dye · 26 sept. 2026 lire l'original ↗
↑