CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 15 votes

LastOPD: Taming Collapse in Latent On-Policy Distillation

QUESTION — Comment surmonter l'effondrement lors de la distillation latente en politique active (on-policy) ?

La distillation en politique active avec supervision latente aligne les états latents d'un élève sur ceux d'un enseignant, mais souffre souvent de gains précoces suivis d'un effondrement sévère des performances malgré l'amélioration de l'alignement. Cela est dû à une inadéquation dans l'application des signaux latents selon les couches. Pour résoudre ce problème, les auteurs proposent LastOPD, qui applique le signal latent exclusivement au niveau de l'état de la dernière couche — l'interface commune lue par les deux têtes de modèle — lors d'un fondu enchaîné de 10 étapes vers l'OPD au niveau des jetons. Des expériences approfondies montrent que LastOPD améliore les scores sur MATH-500 par rapport à l'OPD basé uniquement sur les jetons.

La supervision latente seule fait passer la précision de MATH-500 de 25 à 46 en 10 étapes, mais un entraînement ultérieur dégrade les performances jusqu'à 11 sans récupération.

LastOPD améliore MATH-500 par rapport à l'OPD basé uniquement sur les jetons de 5,55 et 4,02 points avec les enseignants 4B et 8B.

LastOPD atteint le score final de l'OPD à jetons uniques en environ la moitié des étapes.

Muyiiiii · 23 sept. 2026 lire l'original ↗
↑