CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 83 votes

Sharpening Tax in Post-Training

QUESTION — Quel est l'impact de l'entraînement post-apprentissage par renforcement sur le compromis entre la précision à essai unique et la couverture de solutions dans les tâches d'agents ?

L'article examine comment le post-entraînement par renforcement affecte les grands modèles de langage, révélant qu'il pousse les tâches vers des extrêmes et troque la couverture des solutions (pass@K) contre la précision à essai unique (pass@1). Les auteurs proposent la 'Sharpening Tax', une métrique diagnostique quantifiant la perte d'extensibilité au moment du test. Pour atténuer ce problème, ils introduisent le posterior-tempered group sampling (PTGS), un échantillonneur bayésien adaptant la température d'échantillonnage par invite. Évalué sur 14 paires de modèles à travers 3 benchmarks d'agents, PTGS réduit cette taxe et résout davantage de tâches.

Les LLM pré-entraînés dotés d'un harnais d'inférence léger surpassent souvent leurs homologues post-entraînés en matière de couverture de solutions (pass@K).

La Sharpening Tax est une métrique de diagnostic qui quantifie la perte d'extensibilité au moment du test après le post-entraînement.

Le posterior-tempered group sampling (PTGS) paie une taxe plus faible que les modèles de référence à température fixe et résout plus de tâches.

changdae · 01 oct. 2026 lire l'original ↗
↑