CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 18 votes

Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training

QUESTION — Comment exploiter systématiquement les échecs d'agents LLM pour améliorer à la fois le diagnostic d'erreurs et la récupération des acteurs ?

Les auteurs présentent l'Agent Error Dataset (AED) comprenant 50 228 paires d'erreurs et de diagnostics à travers divers environnements, ainsi que le pipeline Agentic Error-to-Training (AET). Ce pipeline collecte les échecs naturels des agents, génère des corrections et les vérifie par rapport aux journaux d'exécution. Les résultats démontrent que l'ajustement fin sur ces données augmente considérablement les taux de réussite des vérificateurs et améliore l'accord des étapes exactes pour des modèles tels que Qwen3-8B par rapport aux références de prompt standard.

First-proposal corrections raise verifier pass rates from 18.4% to 51.1%, a gain of 32.7 percentage points.

Full-diagnosis fine-tuning on 1,656 source tasks raises Qwen3-8B's exact-step agreement with internal teacher labels from 47.2% to 63.6%, averaged over three seeds on a 943-case holdout.

Action-only repair training scores 6.67 percentage points higher on WebShop-lite than success-only training.

Leozkl · 30 sept. 2026 lire l'original ↗
↑