CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 18 upvote

Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training

CÂU HỎI — Làm thế nào để khai thác các thất bại của LLM agent nhằm cải thiện cả chẩn đoán lỗi và hiệu suất tác vụ?

Tác giả giới thiệu Agent Error Dataset (AED) với 50.228 cặp chẩn đoán lỗi từ 9.961 tác vụ trên nhiều môi trường khác nhau. Họ xây dựng đường ống Agentic Error-to-Training (AET) để tự động thu thập lỗi, đề xuất cách sửa và kiểm chứng qua dữ liệu thực tế. Kết quả thử nghiệm cho thấy việc huấn luyện tinh chỉnh giúp cải thiện đáng kể độ chính xác của mô hình Qwen3-8B và tăng tỷ lệ vượt qua bài kiểm tra của bộ xác thực (verifier).

First-proposal corrections raise verifier pass rates from 18.4% to 51.1%, a gain of 32.7 percentage points.

Full-diagnosis fine-tuning on 1,656 source tasks raises Qwen3-8B's exact-step agreement with internal teacher labels from 47.2% to 63.6%, averaged over three seeds on a 943-case holdout.

Action-only repair training scores 6.67 percentage points higher on WebShop-lite than success-only training.

Leozkl · 30 thg 9, 2026 đọc bản gốc ↗
↑