When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
Nous étudions l'inflation de la longueur dans la distillation en politique (OPD), identifiant l'incompatibilité des jetons de fin (EOS) entre les étudiants de base et les enseignants post-entraînés comme une cause majeure de réponses trop longues. Les auteurs démontrent que le traitement des jetons EOS fonctionnellement équivalents comme une action d'arrêt sémantique partagée atténue considérablement cette inflation sur les familles de modèles Qwen3, Llama et Gemma.
L'incompatibilité des jetons de fin entre étudiants de base et enseignants post-entraînés est une source importante d'inflation de la longueur.
L'alignement du seul ensemble d'arrêt de décodage est insuffisant.
Le traitement des jetons EOS fonctionnellement équivalents comme une action d'arrêt sémantique partagée atténue considérablement l'inflation de la longueur sur Qwen3, Llama et Gemma.