When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models
L'article aborde l'inefficacité des Large Reasoning Models, qui surréfléchissent souvent aux problèmes faciles et sous-réfléchissent aux problèmes difficiles. Les auteurs proposent When2Think, un framework de post-entraînement qui alloue dynamiquement le calcul selon la difficulté du problème. La méthode introduit l'Instance-level Difficulty-Aware Control (IDAC), un mécanisme de modelage de récompense exploitant des statistiques de référence pré-calculées. Les résultats expérimentaux sur AIME24 montrent que le Pass@3 augmente de 10.0% tandis que l'utilisation des tokens est réduite de 27.9% par rapport au modèle de base.
Sur AIME24, le Pass@3 augmente de 10.0% tandis que l'utilisation des tokens est réduite de 27.9% par rapport au modèle de base.
Sur AIME25, When2Think atteint 40.0% de Pass@3, surpassant les baselines de compression et de routage.
L'IDAC permet une optimisation stable sans critique, sans modèles de récompense appris ni requêtes de modèles de référence en ligne.