CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 26 votes

Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows

QUESTION — Comment évaluer des agents de données et des flux de travail analytiques sur des entrepôts de données à l'échelle de l'entreprise qui nécessitent de naviguer dans des schémas complexes et d'exécuter des actions consécutives?

Nous introduisons Argo-Bench, un cadre d'évaluation comprenant 210 tâches de science des données et d'analyse simulant une plateforme de livraison de nourriture à New York à grande échelle, avec 81 millions de commandes en 2024 exportées vers un entrepôt ERP de 235 tables et 7,5 milliards de lignes. L'état de référence du simulateur est caché de l'entrepôt vu par l'agent, exigeant de reconstruire les faits en naviguant dans l'entrepôt avant d'agir. Le plus fort des 14 modèles frontaliers et open-weight obtient 95 ou plus sur seulement 34,8% des tâches et une moyenne de 59,5 points.

Argo-Bench simule une plateforme de livraison de nourriture à New York avec 81 millions de commandes en 2024.

L'entrepôt ERP contient 235 tables et 7,5 milliards de lignes modélisées sur le schéma Oracle E-Business Suite.

Le plus fort des 14 modèles frontaliers et open-weight obtient 95 ou plus sur seulement 34,8% des tâches et une moyenne de 59,5 points.

gtomitsu · 01 oct. 2026 lire l'original ↗
↑