ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
Bài báo giới thiệu ProgramDistill, một benchmark đánh giá agent lập trình thông qua các tính năng được khám phá bằng cách tương tác với các ứng dụng tham chiếu hoạt động đầy đủ. Pipeline mine-craft-patch của họ tự động phân tách ứng dụng thành các hành vi có thể thực thi và xác minh lại qua bản vá gold mà không cần can thiệp thủ công, tạo ra 1,975 hành vi qua 26 ứng dụng và 4,063 tác vụ. Đánh giá trên chín agent mã hóa hàng đầu cho thấy GPT-6 Astra và Claude Opus 5 đạt tỷ lệ thành công lần lượt là 49.2% và 28.8% trên các workflow tích lũy khi tái tạo toàn bộ ứng dụng.
Pipeline mine-craft-patch tạo ra 1,975 hành vi được xác minh qua replay trên 26 ứng dụng và xây dựng 4,063 tác vụ tự động.
GPT-6 Astra và Claude Opus 5 đạt 49.2% và 28.8% tỷ lệ thành công trong tái tạo toàn bộ ứng dụng.
Trong tái tạo ứng dụng một phần, tỷ lệ thành công giảm từ 100% xuống 64.0% và từ 96% xuống 32% khi độ sâu khôi phục tăng từ 1 lên 8.