Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
Nous introduisons Argo-Bench, un cadre d'évaluation comprenant 210 tâches de science des données et d'analyse simulant une plateforme de livraison de nourriture à New York à grande échelle, avec 81 millions de commandes en 2024 exportées vers un entrepôt ERP de 235 tables et 7,5 milliards de lignes. L'état de référence du simulateur est caché de l'entrepôt vu par l'agent, exigeant de reconstruire les faits en naviguant dans l'entrepôt avant d'agir. Le plus fort des 14 modèles frontaliers et open-weight obtient 95 ou plus sur seulement 34,8% des tâches et une moyenne de 59,5 points.
Argo-Bench simule une plateforme de livraison de nourriture à New York avec 81 millions de commandes en 2024.
L'entrepôt ERP contient 235 tables et 7,5 milliards de lignes modélisées sur le schéma Oracle E-Business Suite.
Le plus fort des 14 modèles frontaliers et open-weight obtient 95 ou plus sur seulement 34,8% des tâches et une moyenne de 59,5 points.