CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 58 votes

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

QUESTION — Les données d'entraînement réflexives à long horizon peuvent-elles améliorer efficacement les capacités d'auto-amélioration au moment du test des agents LLM sur plusieurs tours ?

L'article présente AREX-2 pour faire progresser l'auto-amélioration au moment du test des agents LLM via la réflexion et l'exécution à long horizon. En synthétisant des trajectoires d'amélioration à long horizon à partir de domaines d'apprentissage automatique et de programmation algorithmique dotés de retours vérifiables, les auteurs entraînent un agent basé sur Qwen3.8-27B. Le système obtient de bons scores sur MLE-bench Lite (81.8) et Frontier-CS (70.7), se transfère vers des benchmarks de recherche approfondie tels que BrowseComp (84.0), HLE (52.6), GAIA (92.2) et DeepSearchQA (93.8), et continue de s'améliorer à mesure que le budget de tours d'itération augmente.

L'agent obtient de solides résultats sur MLE-bench Lite (81.8) et Frontier-CS (70.7).

Il se transfère à la recherche approfondie avec 84.0 sur BrowseComp, 52.6 sur HLE, 92.2 sur GAIA et 93.8 sur DeepSearchQA.

Les performances continuent de s'améliorer à mesure que son budget de tours augmente.

lz1001 · 29 sept. 2026 lire l'original ↗
↑