QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents
Les agents de grands modèles de langage effectuant des tâches à horizon extrêmement long génèrent des interactions massives et des millions de jetons par exécution, provoquant une inactivité des GPU due à la variance d'exécution et à la redondance des trajectoires. Pour résoudre ces problèmes, les auteurs présentent QwenGyre, un cadre d'apprentissage par renforcement en ligne de bout en bout. QwenGyre réalloue de manière élastique les GPU entre l'exécution et l'entraînement sans interrompre les sessions actives, tandis qu'un processeur de trajectoire reconstruit les historiques de ramification, évalue les progrès partiels et déduplique les chemins redondants. Appliqué au modèle Qwen~3.8 2.4T avec 700 000 jetons par exécution, QwenGyre génère des gains absolus substantiels sur NL2RepoBench.
QwenGyre génère un gain absolu de 6,0 % sur NL2RepoBench (de 52,5 % à 58,5 %) en 48 étapes.
QwenGyre offre des accélérations allant jusqu'à 1,85 fois par rapport à Colocate.
QwenGyre offre des accélérations allant jusqu'à 1,78 fois par rapport à Async.