What Makes Recurrence Effective in Looped Language Models?
Cet article étudie les modèles de langage en boucle (LoopLMs), qui augmentent la profondeur de calcul grâce au partage de paramètres sans en ajouter. À travers des expériences contrôlées, les auteurs examinent quand la récurrence aide, où elle doit être appliquée et comment le conditionnement affecte les performances. Ils constatent que la récurrence peut améliorer le raisonnement au-delà de l'horizon d'entraînement tout en dégradant les connaissances. Pour remédier aux limites de l'injection d'état initial, ils proposent l'injection d'état d'historique combinée au conditionnement temporel.
La récurrence peut améliorer le raisonnement au-delà de l'horizon d'entraînement tout en dégradating les performances de connaissance.
Les couches de sortie non récurrentes améliorent la robustesse face au sous-déroulement, tandis que l'emplacement préféré varie selon le budget d'inférence.
L'injection d'état d'historique par canal combinée au conditionnement temporel préserve mieux les connaissances lors d'un déroulement étendu.