Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models
Cette recherche exploite un outil personnalisé simple enregistré via une fonction d'API standard pour inciter les modèles de pointe à externaliser leur raisonnement intermédiaire qui est par ailleurs caché dans les systèmes fermés. En comparant avec le CoT natif sur des modèles ouverts et en l'étendant à des systèmes tels que GPT-6 Astra, les auteurs démontrent que le raisonnement extrait égale les performances du raisonnement natif et surpasse substantiellement les baselines sans raisonnement en mathématiques de compétition, en science et en génération de code. L'analyse structurelle révèle que des modèles comme Astra présentent un raisonnement dirigé efficace en jetons, résolvant les étapes élémentaires en interne tout en externalisant uniquement le raisonnement crucial.