CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 130 votes

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

QUESTION — Comment pouvons-nous mettre à l'échelle automatiquement des environnements d'apprentissage par renforcement pour les agents de code à partir du code source brut ?

Les auteurs présentent CodeMidas, un pipeline agentique qui transforme les fonctionnalités implémentées dans des bases de code open source existantes en environnements d'apprentissage par renforcement exécutables en utilisant uniquement le code source. Le pipeline utilise des agents pour formuler des spécifications comportementales, construire des tests basés sur l'exécution et valider les tâches. Le jeu de données résultant contient 5545 tâches d'entraînement issues de 3185 bases de code sur 23 langages de programmation. L'entraînement de MiMo-V2.5 sur ces tâches améliore les performances sur des benchmarks tels que DeepSWE, ProgramBench et Terminal-Bench v2.1.

CodeMidas produit 5545 tâches d'entraînement provenant de 3185 bases de code open source couvrant 23 langages de programmation et 15 domaines techniques.

L'entraînement de MiMo-V2.5 sur ces tâches améliore les performances sur DeepSWE de +11,7%.

Les performances augmentent également sur ProgramBench de +17% et Terminal-Bench v2.1 de +8.5%.

tobiaslee · 18 sept. 2026 lire l'original ↗
↑