CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — system_design 12 votes

QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

QUESTION — Comment résoudre le sous-régime des GPU et la redondance des trajectoires lors de l'apprentissage par renforcement en ligne pour les agents à horizon très long ?

Les agents de grands modèles de langage effectuant des tâches à horizon extrêmement long génèrent des interactions massives et des millions de jetons par exécution, provoquant une inactivité des GPU due à la variance d'exécution et à la redondance des trajectoires. Pour résoudre ces problèmes, les auteurs présentent QwenGyre, un cadre d'apprentissage par renforcement en ligne de bout en bout. QwenGyre réalloue de manière élastique les GPU entre l'exécution et l'entraînement sans interrompre les sessions actives, tandis qu'un processeur de trajectoire reconstruit les historiques de ramification, évalue les progrès partiels et déduplique les chemins redondants. Appliqué au modèle Qwen~3.8 2.4T avec 700 000 jetons par exécution, QwenGyre génère des gains absolus substantiels sur NL2RepoBench.

QwenGyre génère un gain absolu de 6,0 % sur NL2RepoBench (de 52,5 % à 58,5 %) en 48 étapes.

QwenGyre offre des accélérations allant jusqu'à 1,85 fois par rapport à Colocate.

QwenGyre offre des accélérations allant jusqu'à 1,78 fois par rapport à Async.

chenmouxiang · 27 sept. 2026 lire l'original ↗
↑