CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 47 votes

When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

QUESTION — Comment optimiser l'efficacité computationnelle des Large Reasoning Models en contrôlant dynamiquement la profondeur de raisonnement selon la difficulté du problème ?

L'article aborde l'inefficacité des Large Reasoning Models, qui surréfléchissent souvent aux problèmes faciles et sous-réfléchissent aux problèmes difficiles. Les auteurs proposent When2Think, un framework de post-entraînement qui alloue dynamiquement le calcul selon la difficulté du problème. La méthode introduit l'Instance-level Difficulty-Aware Control (IDAC), un mécanisme de modelage de récompense exploitant des statistiques de référence pré-calculées. Les résultats expérimentaux sur AIME24 montrent que le Pass@3 augmente de 10.0% tandis que l'utilisation des tokens est réduite de 27.9% par rapport au modèle de base.

Sur AIME24, le Pass@3 augmente de 10.0% tandis que l'utilisation des tokens est réduite de 27.9% par rapport au modèle de base.

Sur AIME25, When2Think atteint 40.0% de Pass@3, surpassant les baselines de compression et de routage.

L'IDAC permet une optimisation stable sans critique, sans modèles de récompense appris ni requêtes de modèles de référence en ligne.

junshim · 17 sept. 2026 lire l'original ↗
↑