Explore Broadly, Reason Sharply: Push Small Models toward the Frontier via Sampling
Cet article présente le Parallel Power Tempering (PPT), une alternative au post-entraînement par RL au moment de l'inférence pour améliorer le raisonnement des LLM grâce à un échantillonnage à puissance accentuée en parallèle. En exécutant plusieurs répliques en parallèle à différents niveaux d'accentuation, PPT résout le compromis entre exploration et exploitation. L'article atténue un biais de troncature et étudie des stratégies d'échange efficaces. Des expériences approfondies montrent qu'il améliore l'échantillonnage à chaîne unique et surpasse les modèles entraînés par RL.
Le Parallel Power Tempering (PPT) instancie un échantillonnage à puissance accentuée via un tempering parallèle pour résoudre le compromis exploration-exploitation.
PPT atténue un biais de troncature identifié dans les échantillonneurs de puissance antérieurs.
Des expériences approfondies montrent que PPT améliore considérablemente l'échantillonnage à chaîne unique et surpasse les modèles post-entraînés par RL.