Scheduling Recursive Reasoning in Looped Transformers
QUESTION — Comment ajuster dynamiquement l'échelle de mise à jour dans les modèles de raisonnement récurrent pour améliorer l'efficacité de l'inférence ?
Cet article analyse la sensibilité de la perte terminale aux échelles de mise à jour récurrente dans les modèles transformer bouclés. En décomposant les moyennes temporelles en contributions de progrès persistant et de fluctuation centrée, les auteurs introduisent TAPS pour adapter dynamiquement la taille des pas en ligne. Les expériences montrent que TAPS améliore la précision et offre jusqu'à 1.56 times d'accélération.
TAPS yields additional accuracy gains with up to 1.56 times wall-clock speedup at matched baseline accuracy.
ElvisWang111 · 29 sept. 2026
lire l'original ↗