Learning from Teacher Continuations at Student States
OLIVE (OnLine InterVEntion) est présenté pour remédier aux limites de la distillation de modèles de langage, telles que le décalage de co-variates et la supervision fragmentée. À chaque itération, l'étudiant génère un préfixe, l'enseignant le complète en mode autorégressif, et l'étudiant est mis à jour par entropie croisée. Une mise en œuvre asynchrone réduit en outre le temps d'entraînement total de OLIVE de 23.8%. Évalué sur des tâches de raisonnement et d'agents, OLIVE surpasse systématiquement les méthodes existantes et surpasse le SFT hors ligne de 13% sur ScienceWorld en utilisant des données de GPT-5.4-mini.
Une mise en œuvre asynchrone réduit le temps d'entraînement total de OLIVE de 23.8%.
L'entraînement continu avec OLIVE surpasse le SFT hors ligne du même enseignant de 13% sur ScienceWorld.
OLIVE continue de s'améliorer après la stagnation de la distillation hors ligne.