SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
Nghiên cứu này áp dụng cách tiếp cận tự cải tiến đệ quy (RSI) tại tầng harness nhằm giải quyết bài toán hiệu quả token cho các coding agent hoạt động suốt ngày đêm. Tác giả phát triển SoL-Pi thông qua việc mở rộng các vòng lặp auto-research trên nhiều môi trường đa dạng để trích xuất 4 cơ chế tối ưu gồm thực thi hành động, nén ngữ cảnh, xử lý quan sát và đọc được ủy quyền. Trên benchmark EdgeBench gồm 51 tác vụ, SoL-Pi đạt hiệu năng tương đương các mô hình hàng đầu nhưng giảm lượng token traffic từ 44.7-49.0% và chi phí API khoảng một phần ba.
SoL-Pi tích hợp 4 cơ chế gồm action execution, context compaction, observation handling và delegated reading.
Đạt hiệu năng tương đương Pi trên GPT-5.6 Sol và Opus 5 tại 51-task EdgeBench.
Giảm token traffic từ 44.7-49.0% và tiết kiệm chi phí API khoảng một phần ba.