Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It
L'étude montre que les transformers pré-entraînés n'utilisent qu'une faible partie de leur profondeur pour le suivi de références contextuelles, 13 modèles de base ne suivant de manière fiable que 1,4 à 3,6 lignes. Pour remédier à cela, les auteurs introduisent un LoRA de rang 8 entraîné sur une tâche à une couche précoce tout en gelant tous les poids du modèle. Ce mécanisme déclenche un effet de relais à travers les couches intermédiaires, étendant considérablement la profondeur de calcul pour traiter des chaînes de 50 lignes à plus de 160 lignes.
Thirteen base models reliably follow only 1.4-3.6 lines.
Qwen3-8B improves from 15.5% to 99% exact accuracy on 24-line chains.
Ouro-1.4B reaches 60 lines after four loops and at least 160 after eight.