CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 201 upvote

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

CÂU HỎI — Làm thế nào để áp dụng quy trình tự cải tiến đệ quy cho các harness của LLM agent mà không bị hiện tượng quá khớp (overfitting)?

Bài báo giới thiệu Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), một phương pháp tích hợp các nguyên tắc điều chuẩn vào quá trình tự cải tiến đệ quy của agent harness (gồm prompt, điều khiển luồng, công cụ và bộ nhớ). Bộ đề xuất (proposer) áp dụng ngân sách theo thời gian kết hợp khuyến khích các quỹ đạo chưa được khám phá, trong khi bộ lựa chọn (selector) sử dụng một bộ đánh giá (critic) và bộ cắt tỉa (pruner) để loại bỏ các thay đổi kém chất lượng hoặc gây nhiễu. Thực nghiệm trên tám benchmark cho thấy RRSI cải thiện hiệu suất đáng kể trên cả tập huấn luyện và tập ngoài phân phối, đồng thời giảm 30% lượng token chính sách.

RRSI cải thiện tới 14.1 điểm trên tập phát triển và tới 4.7 điểm trên năm benchmark ngoài phân phối.

Harness được tạo ra chạy với lượng policy token ít hơn 30% so với phương pháp tiến hóa không được điều chuẩn.

richardxp888 · 21 thg 9, 2026 đọc bản gốc ↗
↑