CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 23 votes

Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge

QUESTION — Comment les petits modèles de raisonnement peuvent-ils interroger sélectivement des modèles plus puissants lorsqu'ils rencontrent des goulots d'étranglement de connaissances ?

Cet article étudie la mise à l'échelle du calcul au moment de l'inférence pour les petits modèles de raisonnement (sRMs), constatant que l'auto-raffinement consolide souvent la probabilité sur des solutions déjà accessibles. Les auteurs identifient des goulots d'étranglement d'exécution et de connaissances, et présentent FlyBy, un cadre de requête sélective où les modèles raisonnent, diagnostiquent les parties non résolues et interrogent des modèles plus puissants en cas de besoin. En utilisant un supervised fine-tuning multi-profondeur et un reinforcement learning conscient des coûts, l'approche permet aux petits modèles d'égaler ou de surpasser des modèles beaucoup plus grands à moindre coût.

Sur 1 158 problèmes difficiles répartis sur six benchmarks, FlyBy-4B atteint 45,96 % de pass@8, surpassant Qwen3-14B (41,64 %) avec un coût de service 2,7 fois inférieur, tout en dépassant Qwen3-8B en pass@1 (16,85 % contre 15,31 %).

L'extension à FlyBy-8B améliore encore le pass@8 à 51,81 %.

tally0818 · 28 sept. 2026 lire l'original ↗
↑