Marathoner: Ultra-Long-Horizon Autonomous Intelligence
Cet article présente Marathoner, un modèle d'agent autonome capable d'exécuter des tâches sur un horizon ultra-long. Les auteurs proposent un pipeline de post-entraînement complet comprenant la synthèse de tâches à partir de PR GitHub majeures, le chaînage multi-tâches, le réglage par échantillonnage de rejet et l'apprentissage par renforcement avec des bacs à sable indépendants. De plus, une stratégie de récompense de fin de parcours encourage les manœuvres significatives, permettant au modèle de gérer des milliers d'appels d'outils.
Marathoner achieves consistent and substantial performance improvements over base model and even surpasses performance of strong proprietary model.
Marathoner can consistently work for 10+ hours and conduct 1000+ tool calls on highly challenging tasks.