Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite
Nghiên cứu giới thiệu Recursive Self-Rewrite (RSR), một framework sử dụng mô hình cơ sở Qwen-3.8-27B để chuyển đổi các giải pháp thành công từ nhiều harness chuyên biệt thành dữ liệu huấn luyện dưới một harness tổng quát. Hệ thống dùng một planner để trích xuất quy trình thành runbook, một critic để kiểm duyệt rò rỉ và định hướng sửa đổi đệ quy, và một executor để chạy trong sandbox mới. Thử nghiệm trên khoảng 3K tác vụ thiết bị đầu cuối cho thấy việc huấn luyện trên các quỹ đạo được viết lại này giúp cải thiện đáng kể điểm số pass@3 trên Terminal-Bench và các benchmark khác.
RSR sử dụng Qwen-3.8-27B để trích xuất và viết lại các quỹ đạo thành dữ liệu huấn luyện tổng quát.
Hệ thống kết hợp ba harness giúp giải quyết 759 tác vụ, cao hơn 34.3% so với harness đơn lẻ mạnh nhất.
Điểm pass@3 trên Terminal-Bench 2 tăng từ 57.0% lên 74.2% sau khi huấn luyện trên dữ liệu RSR.