CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 5 votes

Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures

QUESTION — Comment améliorer la précision de l'attribution des causes profondes pour les échecs d'exécution d'agents à long horizon au-delà des jugements LLM uniques ?

Cette étude aborde l'attribution automatisée des causes profondes (RCA) pour les échecs d'agents IA à long horizon, où les journaux d'exécution sont massifs. Les auteurs présentent Continual Search, un cadre itératif qui incite le juge LLM, au fil de tours successifs, à continuer de chercher des preuves diagnostiques non résolues pour éviter des conclusions prématurées. Pour évaluer la RCA à grande échelle, ils introduisent MegaRCA-Mix, comprenant 50 essais d'échec annotés par des humains. Les expériences montrent des gains de performance significatifs, démontrant qu'une recherche efficace l'emporte sur la simple échelle du modèle.

MegaRCA-Mix propose un banc d'essai difficile de 50 essais d'échec annotés par des humains couvrant des tâches à long horizon et lourdes en exécution.

Sur MegaRCA-Mix, il améliore le score F1 de GPT-5.5 de plus de 40 %, passant de 0,349 à 0,498.

Au sein d'une même famille de modèles, les modèles de rang inférieur peuvent même surpasser leurs homologues de rang supérieur, démontrant qu'une recherche efficace prime sur l'échelle brute du modèle.

Harsh1729 · 11 sept. 2026 lire l'original ↗
↑