Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training
Les auteurs présentent l'Agent Error Dataset (AED) comprenant 50 228 paires d'erreurs et de diagnostics à travers divers environnements, ainsi que le pipeline Agentic Error-to-Training (AET). Ce pipeline collecte les échecs naturels des agents, génère des corrections et les vérifie par rapport aux journaux d'exécution. Les résultats démontrent que l'ajustement fin sur ces données augmente considérablement les taux de réussite des vérificateurs et améliore l'accord des étapes exactes pour des modèles tels que Qwen3-8B par rapport aux références de prompt standard.
First-proposal corrections raise verifier pass rates from 18.4% to 51.1%, a gain of 32.7 percentage points.
Full-diagnosis fine-tuning on 1,656 source tasks raises Qwen3-8B's exact-step agreement with internal teacher labels from 47.2% to 63.6%, averaged over three seeds on a 943-case holdout.
Action-only repair training scores 6.67 percentage points higher on WebShop-lite than success-only training.