Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures
Cette étude aborde l'attribution automatisée des causes profondes (RCA) pour les échecs d'agents IA à long horizon, où les journaux d'exécution sont massifs. Les auteurs présentent Continual Search, un cadre itératif qui incite le juge LLM, au fil de tours successifs, à continuer de chercher des preuves diagnostiques non résolues pour éviter des conclusions prématurées. Pour évaluer la RCA à grande échelle, ils introduisent MegaRCA-Mix, comprenant 50 essais d'échec annotés par des humains. Les expériences montrent des gains de performance significatifs, démontrant qu'une recherche efficace l'emporte sur la simple échelle du modèle.
MegaRCA-Mix propose un banc d'essai difficile de 50 essais d'échec annotés par des humains couvrant des tâches à long horizon et lourdes en exécution.
Sur MegaRCA-Mix, il améliore le score F1 de GPT-5.5 de plus de 40 %, passant de 0,349 à 0,498.
Au sein d'une même famille de modèles, les modèles de rang inférieur peuvent même surpasser leurs homologues de rang supérieur, démontrant qu'une recherche efficace prime sur l'échelle brute du modèle.