AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
L'article présente AREX-2 pour faire progresser l'auto-amélioration au moment du test des agents LLM via la réflexion et l'exécution à long horizon. En synthétisant des trajectoires d'amélioration à long horizon à partir de domaines d'apprentissage automatique et de programmation algorithmique dotés de retours vérifiables, les auteurs entraînent un agent basé sur Qwen3.8-27B. Le système obtient de bons scores sur MLE-bench Lite (81.8) et Frontier-CS (70.7), se transfère vers des benchmarks de recherche approfondie tels que BrowseComp (84.0), HLE (52.6), GAIA (92.2) et DeepSearchQA (93.8), et continue de s'améliorer à mesure que le budget de tours d'itération augmente.
L'agent obtient de solides résultats sur MLE-bench Lite (81.8) et Frontier-CS (70.7).
Il se transfère à la recherche approfondie avec 84.0 sur BrowseComp, 52.6 sur HLE, 92.2 sur GAIA et 93.8 sur DeepSearchQA.
Les performances continuent de s'améliorer à mesure que son budget de tours augmente.