One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
Cet article propose un cadre d'entraînement d'experts conscient des catégories et d'intégration de politiques pour résoudre les progrès inégaux entre les catégories de tâches lors de l'apprentissage par renforcement groupé pour le génie logiciel. En combinant Agentic-miniRL, la stratégie Refresh-Repair-Expand (RRE) et un étiquetage multi-axe via SWE Labeler, des experts spécifiques par catégorie sont formés. Une méthode de distillation sur politique multi-professeur routée par étiquette (MOPD) avec extrapolation de récompense guidée par ReLU consolide ensuite ces experts en un seul étudiant déployable. La politique finale atteint une résolution moyenne de 58,04 % sur Pro-618 et 59,00 % sur SWE-bench Multilingual.
The final MOPD policy achieves mean resolution of 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
It improves over the base model by 5.39 and 2.78 percentage points, respectively.