CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 24 votes

Selecting Diverse SFT Traces Improves Post-RL Generalization

QUESTION — Comment la diversité des chemins de raisonnement dans les données SFT affecte-t-elle la généralisation du modèle après l'apprentissage par renforcement ?

Cet article étudie la diversité des routes — la variation des séquences d'étapes de raisonnement dans les données de supervised fine-tuning (SFT) — pour préparer les modèles de raisonnement au reinforcement learning (RL). Les auteurs proposent une empreinte légère, basée sur des règles et fonctionnant uniquement sur processeur pour sélectionner cette diversité. Les expériences démontrent que la sélection de routes diverses améliore la couverture des problèmes après RL dans les puzzles et les mathématiques. Les diagnostics révèlent que le SFT diversifié génère à la fois des tentatives réussies et échouées sur un plus grand nombre de prompts, fournissant au RL des signaux d'apprentissage plus riches.

Dans des expériences synthétiques, le SFT diversifié en routes améliore le pass@8 d'OLMo3-7B de 16,9 points sur des environnements non vus lors du SFT.

Dans une condition à modèle unique, la sélection diverse gagne jusqu'à 6,2 points de pass@8 moyen à travers 10 benchmarks mathématiques.

Sur 3 corpus open source, notre sélecteur fonctionnant uniquement sur CPU surpasse des alternatives plus coûteuses dans chaque comparaison de performance moyenne après RL.

shizhuo2 · 27 sept. 2026 lire l'original ↗
↑