CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 26 upvote

Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows

CÂU HỎI — Làm thế nào để đánh giá các tác nhân khoa học dữ liệu và phân tích doanh nghiệp trên các quy mô lớn đòi hỏi phải điều hướng cơ sở dữ liệu phức tạp và thực hiện các hành động thực tế?

Nghiên cứu giới thiệu Argo-Bench, một khung đánh giá bao gồm 210 tác vụ khoa học dữ liệu và phân tích phỏng theo nền tảng giao đồ ăn tại thành phố New York với quy mô thực tế, bao gồm 81 triệu đơn hàng trong năm 2024 được xuất ra kho ERP với 235 bảng và 7,5 tỷ hàng. Trạng thái thực tế của bộ giả lập được giấu đi, yêu cầu tác nhân phải tái tạo các sự thật bằng cách điều hướng kho trước khi thực hiện hành động như cấm tài khoản gian lận hoặc phân bổ ngân sách ưu đãi. Kết quả cho thấy mô hình hàng đầu chỉ đạt điểm 95 trở lên trên 34,8% tác vụ và đạt trung bình 59,5 điểm.

Argo-Bench mô phỏng nền tảng giao đồ ăn tại Thành phố New York với 81 triệu đơn hàng trong năm 2024.

Kho ERP chứa 235 bảng và 7,5 tỷ hàng dựa trên lược đồ Oracle E-Business Suite.

Mô hình mạnh nhất trong số 14 mô hình biên và trọng số mở đạt điểm 95 trở lên trên chỉ 34,8% tác vụ và đạt trung bình 59,5 điểm.

gtomitsu · 01 thg 10, 2026 đọc bản gốc ↗
↑