CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 9 votes

Explore Broadly, Reason Sharply: Push Small Models toward the Frontier via Sampling

QUESTION — Comment l'échantillonnage au moment de l'inférence peut-il améliorer le raisonnement des petits modèles sans mise à jour des paramètres ni RL ?

Cet article présente le Parallel Power Tempering (PPT), une alternative au post-entraînement par RL au moment de l'inférence pour améliorer le raisonnement des LLM grâce à un échantillonnage à puissance accentuée en parallèle. En exécutant plusieurs répliques en parallèle à différents niveaux d'accentuation, PPT résout le compromis entre exploration et exploitation. L'article atténue un biais de troncature et étudie des stratégies d'échange efficaces. Des expériences approfondies montrent qu'il améliore l'échantillonnage à chaîne unique et surpasse les modèles entraînés par RL.

Le Parallel Power Tempering (PPT) instancie un échantillonnage à puissance accentuée via un tempering parallèle pour résoudre le compromis exploration-exploitation.

PPT atténue un biais de troncature identifié dans les échantillonneurs de puissance antérieurs.

Des expériences approfondies montrent que PPT améliore considérablemente l'échantillonnage à chaîne unique et surpasse les modèles post-entraînés par RL.

jiangnanhugo · 29 sept. 2026 lire l'original ↗
↑