Sharpening Tax in Post-Training
L'article examine comment le post-entraînement par renforcement affecte les grands modèles de langage, révélant qu'il pousse les tâches vers des extrêmes et troque la couverture des solutions (pass@K) contre la précision à essai unique (pass@1). Les auteurs proposent la 'Sharpening Tax', une métrique diagnostique quantifiant la perte d'extensibilité au moment du test. Pour atténuer ce problème, ils introduisent le posterior-tempered group sampling (PTGS), un échantillonneur bayésien adaptant la température d'échantillonnage par invite. Évalué sur 14 paires de modèles à travers 3 benchmarks d'agents, PTGS réduit cette taxe et résout davantage de tâches.
Les LLM pré-entraînés dotés d'un harnais d'inférence léger surpassent souvent leurs homologues post-entraînés en matière de couverture de solutions (pass@K).
La Sharpening Tax est une métrique de diagnostic qui quantifie la perte d'extensibilité au moment du test après le post-entraînement.
Le posterior-tempered group sampling (PTGS) paie une taxe plus faible que les modèles de référence à température fixe et résout plus de tâches.