CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 28 votes

OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

QUESTION — Comment évaluer systématiquement les agents VLM utilisant l'ordinateur sur des flux de travail scientifiques spécialisés ?

Les auteurs présentent OSWorld-Science, un benchmark et un environnement d'évaluation combinant des tâches scientifiques significatives, une évaluation basée sur les artefacts et un harness d'agent efficace pour l'utilisation de l'ordinateur. Le benchmark contient 12 VLM et 146 tâches de haute qualité dans des domaines scientifiques tels que le dessin moléculaire, l'analyse d'images de pathologie, le calcul statistique et la simulation physique. Des évaluateurs basés sur l'exécution inspectent les états des applications et les artefacts générés. Un harness intégré prend en charge les adaptateurs de modèles, le contrôle de la boucle d'interaction et la journalisation des trajectoires.

Le benchmark contient 12 VLM et 146 high-quality tasks dans plusieurs domaines scientifiques et configurations logicielles.

iLOVE2D · 30 sept. 2026 lire l'original ↗
↑