CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 61 upvote

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

CÂU HỎI — Làm thế nào để tự động đánh giá các agent lập trình dựa trên hành vi tương tác thu được từ các ứng dụng web thực tế thay vì chỉ qua các hướng dẫn tĩnh?

Bài báo giới thiệu ProgramDistill, một benchmark đánh giá agent lập trình thông qua các tính năng được khám phá bằng cách tương tác với các ứng dụng tham chiếu hoạt động đầy đủ. Pipeline mine-craft-patch của họ tự động phân tách ứng dụng thành các hành vi có thể thực thi và xác minh lại qua bản vá gold mà không cần can thiệp thủ công, tạo ra 1,975 hành vi qua 26 ứng dụng và 4,063 tác vụ. Đánh giá trên chín agent mã hóa hàng đầu cho thấy GPT-6 Astra và Claude Opus 5 đạt tỷ lệ thành công lần lượt là 49.2% và 28.8% trên các workflow tích lũy khi tái tạo toàn bộ ứng dụng.

Pipeline mine-craft-patch tạo ra 1,975 hành vi được xác minh qua replay trên 26 ứng dụng và xây dựng 4,063 tác vụ tự động.

GPT-6 Astra và Claude Opus 5 đạt 49.2% và 28.8% tỷ lệ thành công trong tái tạo toàn bộ ứng dụng.

Trong tái tạo ứng dụng một phần, tỷ lệ thành công giảm từ 100% xuống 64.0% và từ 96% xuống 32% khi độ sâu khôi phục tăng từ 1 lên 8.

beanie00 · 16 thg 9, 2026 đọc bản gốc ↗
↑