CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 47 upvote

TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces

CÂU HỎI — Làm thế nào để tự động xây dựng các bộ benchmark đánh giá hành vi tác nhân từ các trace triển khai thực tế?

Bài báo giới thiệu TraceDance, một hệ thống tác nhân tự động xây dựng các benchmark hành vi từ các trace triển khai thực tế nhằm phát hiện các hành vi không mong muốn. Hệ thống sử dụng cơ chế Anchor-and-Confirm kết hợp tìm kiếm lập trình và xác nhận bằng Flash LLM, cùng với Anchor Synthesis Loop để tạo và chỉnh sửa đặc tả hành vi. Việc đánh giá sử dụng tiếp nối điểm quyết định mà không cần câu trả lời mẫu hay chạy lại môi trường. Kết quả thực nghiệm trên hàng trăm nghìn phiên cho thấy các LLM hiện tại vẫn gặp nhiều khó khăn khi phản hồi tại các điểm quyết định được đánh giá.

Experiments in coding and general tool use draw on 252,557 sessions and produce 107 benchmarks with 4,125 instances, fulfilling 95.3% of build-target requests.

Both human annotators confirm the requested behavior in 84% of sampled instances, and the automated grader's agreement with human pass/fail judgments is comparable to that between the annotators.

Nine frontier LLMs achieve a mean pass rate of only 26.7%, showing that they still struggle to respond appropriately at the evaluated decision points.

ZhishanQ · 27 thg 9, 2026 đọc bản gốc ↗
↑