CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 111 votes

Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

QUESTION — Comment redistribuer le crédit dans l'apprentissage par renforcement des agents de code pour favoriser des implémentations propres et ciblées plutôt que celles contenant des changements inutiles ?

L'article souligne que le GRPO attribue des avantages identiques à toutes les trajectoires réussissant les tests pour les agents de code, ignorant la qualité d'implémentation. Pour y remédier, les auteurs présentent GAGAR, un cadre de redistribution du crédit sensible à la qualité. GAGAR conserve les groupes mixtes de trajectoires dans un espace partagé où un « agentic grader » formé par SFT classe les candidats. Il pondère ensuite à la baisse les trajectoires moins bien classées et redimensionne les avantages pour préserver leur somme, stabilisant l'entraînement sur des checkpoints MiMo-V2.6.

GAGAR résout la limite du GRPO en introduisant une redistribution du crédit sensible à la qualité pour les agents de code.

GAGAR effectue une redistribution des avantages préservant la somme pour privilégier les implémentations de meilleure qualité.

Des évaluations à grande échelle sont menées à l'aide de points de contrôle SFT pré-RL de MiMo-V2.6-Flash (310B total parameters) et MiMo-V2.6-Pro (1.02T total parameters).

whatseeker · 26 sept. 2026 lire l'original ↗
↑