CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 208 upvote

ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement

CÂU HỎI — Làm thế nào để cải thiện đệ quy agent harness nhằm tránh việc học vẹt benchmark và đảm bảo tính tổng quát hóa trên các nhiệm vụ chưa từng thấy?

Bài báo đề xuất ModularRSI, một framework tiến hóa harness mang tính đối kháng, theo dạng mô-đun và tách biệt hoàn toàn với benchmark đánh giá. Hệ thống phân rã harness thành năm chức năng riêng biệt như Agent Loop và Tool Use, đồng thời sử dụng 2.000 tác vụ huấn luyện thu thập ngoài đời thực. Các thử nghiệm trên TB2.0 và SWE-Bench Verified cho thấy cải thiện nhất quán trên các tác vụ trong miền lẫn ngoài miền, đồng thời hỗ trợ chuyển giao tốt qua các foundation model khác nhau.

ModularRSI tuyển chọn 2.000 tác vụ tiến hóa có thể thực thi được từ các nguồn bên ngoài, hoàn toàn tách biệt với các benchmark đánh giá hạ nguồn.

Hệ thống phân rã harness thành năm module chức năng phát triển độc lập trong phạm vi giới hạn.

Các thử nghiệm trên TB2.0 và SWE-Bench Verified cho thấy sự cải thiện nhất quán trên các tác vụ trong miền và ngoài miền chưa từng thấy.

SiweiWu · 14 thg 9, 2026 đọc bản gốc ↗
↑