CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 21 votes

Smaller Models, Better Rejects: Preference Distillation Scaling

QUESTION — Quel est l'impact de l'utilisation de modèles plus petits et gelés pour générer des rejets dans la distillation de préférences sur l'apprentissage des étudiants?

Cette recherche examine la distillation de préférences et remet en question l'hypothèse selon laquelle les rejets doivent provenir de réponses générées par l'étudiant lui-même ou par des modèles de taille équivalente. Les auteurs découvrent que des modèles plus petits et gelés peuvent générer des rejets avec moins de calculs d'inférence tout en entraînant des étudiants plus performants en génération de code et en raisonnement mathématique. Soutenus par une borne d'utilité à horizon fini dérivée, ils proposent des interventions telles que le mélange de rejets provenant de modèles plus petits et de taille étudiante, le mélange de jetons de code tout en conservant la structure de la tâche, et la sélection de candidats ayant une probabilité plus faible sous la politique de référence pour améliorer le transfert net.

Smaller frozen models generate rejects with less inference compute yet train stronger students than self-generated rejects, before and after sequence-level knowledge distillation, on code generation and mathematical reasoning.

Mixing rejects from smaller and student-scale models improves performance as the smaller model's share increases.

Lower-likelihood selections outperform higher-likelihood ones for every source.

luisrui · 30 sept. 2026 lire l'original ↗
↑