Marathoner: Ultra-Long-Horizon Autonomous Intelligence
CÂU HỎI — Làm thế nào để huấn luyện một mô hình agent tự trị có khả năng thực thi các tác vụ cực kỳ dài hạn?
Bài báo đề xuất Marathoner, một agent tự trị được thiết kế để xử lý các tác vụ kéo dài hàng tháng trời. Nhóm tác giả xây dựng một pipeline hậu huấn luyện toàn diện bao gồm tổng hợp tác vụ siêu dài hạn từ các PR GitHub lớn, xích hóa đa tác vụ (multi-task chaining), và chiến lược thưởng giai đoạn sau (Later Stage Bonus Reward) trong quá trình học tăng cường với sandbox độc lập. Kết quả cho thấy mô hình có thể duy trì hoạt động liên tục hàng chục giờ và thực hiện hàng ngàn lời gọi công cụ.
Marathoner achieves consistent and substantial performance improvements over base model and even surpasses performance of strong proprietary model.
Marathoner can consistently work for 10+ hours and conduct 1000+ tool calls on highly challenging tasks.
Ruiyang-061X · 28 thg 9, 2026
đọc bản gốc ↗