AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
Nghiên cứu giới thiệu AREX-2 nhằm nâng cao năng lực tự cải thiện của agent LLM ở thời điểm kiểm thử thông qua phản chiếu và thực thi dài hạn. Nhóm tác giả tổng hợp các quỹ đạo cải tiến dài hạn từ các tác vụ lập trình thuật toán và học máy có phản hồi xác thực. Xây dựng dựa trên mô hình Qwen3.8-27B, agent đạt kết quả cao trên MLE-bench Lite (81.8) và Frontier-CS (70.7), đồng thời chuyển giao tốt sang các tác vụ nghiên cứu sâu như BrowseComp (84.0), HLE (52.6), GAIA (92.2) và DeepSearchQA (93.8), với hiệu năng tiếp tục tăng khi mở rộng ngân sách vòng lặp.
Agent đạt 81.8 trên MLE-bench Lite và 70.7 trên Frontier-CS.
Agent đạt 84.0 trên BrowseComp, 52.6 trên HLE, 92.2 trên GAIA và 93.8 trên DeepSearchQA.
Hiệu suất tiếp tục cải thiện khi ngân sách các vòng lặp tăng lên.