Selecting Diverse SFT Traces Improves Post-RL Generalization
Cet article étudie la diversité des routes — la variation des séquences d'étapes de raisonnement dans les données de supervised fine-tuning (SFT) — pour préparer les modèles de raisonnement au reinforcement learning (RL). Les auteurs proposent une empreinte légère, basée sur des règles et fonctionnant uniquement sur processeur pour sélectionner cette diversité. Les expériences démontrent que la sélection de routes diverses améliore la couverture des problèmes après RL dans les puzzles et les mathématiques. Les diagnostics révèlent que le SFT diversifié génère à la fois des tentatives réussies et échouées sur un plus grand nombre de prompts, fournissant au RL des signaux d'apprentissage plus riches.
Dans des expériences synthétiques, le SFT diversifié en routes améliore le pass@8 d'OLMo3-7B de 16,9 points sur des environnements non vus lors du SFT.
Dans une condition à modèle unique, la sélection diverse gagne jusqu'à 6,2 points de pass@8 moyen à travers 10 benchmarks mathématiques.
Sur 3 corpus open source, notre sélecteur fonctionnant uniquement sur CPU surpasse des alternatives plus coûteuses dans chaque comparaison de performance moyenne après RL.