WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
Nghiên cứu giới thiệu WhatWorkedBench để đo lường khả năng hiểu biết thực nghiệm của AI agent thông qua việc dự đoán điểm số cấu hình sau các thử nghiệm có ngân sách. Agent kiểm tra mã nguồn, chọn các phép đo và nộp một bảng phản hồi dự đoán điểm cho mọi cấu hình. Thực thi CPU toàn diện cung cấp dữ liệu tham chiếu cho 36 tác vụ từ 30 nguồn dữ liệu và 8 loại workflow với 1.248 bản ghi cấu hình. Kết quả cho thấy việc fit một Gaussian process (GP) vào các quan sát của agent làm tăng khả năng khôi phục hiệu ứng (effect recovery) từ 0.632 lên 0.698 ở nhóm Flash ban đầu và từ 0.621 lên 0.720 ở nhóm bổ sung. Việc mã hóa các cấu hình có hành vi tương đương cũng giúp tăng độ khôi phục của GP từ 0.248 lên 0.462.
Exhaustive CPU execution cung cấp hiệu ứng tham chiếu trên 36 tác vụ từ 30 nguồn dữ liệu và 8 loại workflow với 1.248 bản ghi cấu hình.
Fitting một Gaussian process vào quan sát của agent làm tăng effect recovery từ 0.632 lên 0.698 ở nhóm Flash ban đầu và từ 0.621 lên 0.720 ở nhóm bổ sung.
Mã hóa các cấu hình tương đương về mã nguồn giúp nâng độ khôi phục của GP từ 0.248 lên 0.462 trên 6 workflow.