CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 55 votes

ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization

QUESTION — Comment l'apprentissage par curriculum automatisé peut-il optimiser les scénarios d'entraînement parallèlement à l'évolution des harnais d'agents LLM plutôt que de s'appuyer sur des ordres de scénarios statiques ?

Les auteurs présentent ActiveSaddler, qui formule l'optimisation automatisée des harnais comme un problème d'apprentissage par curriculum automatisé. ActiveSaddler modélise le curriculum d'entraînement en évolution sous la forme d'un bandit non stationnaire doté d'objectifs d'optimisation instanciés dynamiquement, équilibrant la révision des faiblesses connues et l'exploration de nouveaux scénarios d'échec. Des expériences sur GAIA2 et Terminal-Bench 2.0 montrent qu'ActiveSaddler découvre systématiquement de meilleurs harnais, améliorant le Pass@1 de test de 4,4 et 7,5 points de pourcentage par rapport à un ordre de scénarios fixe.

ActiveSaddler améliore le Pass@1 de test de 4,4 points de pourcentage sur GAIA2 par rapport à un optimiseur utilisant un ordre de scénario fixe.

Il améliore le Pass@1 de test de 7,5 points de pourcentage sur Terminal-Bench 2.0 par rapport à la référence à ordre fixe.

pshlego · 01 oct. 2026 lire l'original ↗
↑