Recursive self-improvement of AI research agents
Bài báo giới thiệu AIDE^2, một hệ thống thực thi vòng lặp recursive self-improvement cho frontier AI research agent. Hệ thống này tự đề xuất các thay đổi trên mã nguồn của chính nó, benchmark các phiên bản chỉnh sửa trên các tác vụ R&D của AI và giữ lại những phiên bản cải tiến tốt nhất dựa trên đánh giá ẩn. Trong một đợt chạy tự động kéo dài 8 ngày, AIDE^2 đã phát hiện 7 cải tiến liên tiếp từ chính sách tìm kiếm đến cơ chế nén ngữ cảnh. Các cải tiến này giúp agent đạt hiệu suất ngang hoặc vượt qua production research agent của con người trên 4 benchmark bao gồm cả những bài toán out of distribution, đồng thời làm giảm tỷ lệ reward hacking.
AIDE^2 thực hiện đợt chạy tự động trong 8 ngày để tối ưu hóa code nghiên cứu của chính nó.
Hệ thống tự động khám phá bảy cải tiến liên tiếp từ chính sách tìm kiếm đến cơ chế quản lý ngữ cảnh.
Tỷ lệ reward hacking giảm từ 55% xuống còn 32% trong suốt quá trình chạy tự động.