CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 10 votes

WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents

QUESTION — Comment mesurer et améliorer la compréhension expérimentale des agents IA concernant l'impact des modifications de composants sur les résultats?

L'étude introduit WhatWorkedBench pour mesurer la compréhension expérimentale, c'est-à-dire la précision des prédictions sur les changements de composants après une expérimentation budgétisée. Les agents inspectent le code, choisissent des mesures et soumettent une surface de réponse prédisant les scores pour chaque configuration. L'exécution CPU exhaustive fournit des effets de référence sur 36 tâches issues de 30 sources de données et 8 types de flux de travail. L'ajustement d'un processus gaussien (GP) aux observations de l'agent fait passer la récupération des effets de 0,632 à 0,698 dans la cohorte Flash d'origine.

L'exécution CPU exhaustive fournit des effets de référence sur 36 tâches provenant de 30 sources de données et 8 types de flux, avec 1248 enregistrements.

L'ajustement d'un processus gaussien aux observations élève la récupération des effets de 0,632 à 0,698 dans la cohorte Flash originale et de 0,621 à 0,720 dans une autre.

L'encodage des équivalences de code fait passer la récupération du GP de 0,248 à 0,462 sur six flux de travail.

ethanning · 23 sept. 2026 lire l'original ↗
↑