CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 19 votes

MintAct: A Unified Visual Agent for Digital Environments

QUESTION — Comment peut-on entraîner une famille de modèles vision-langage unifiés pour gérer l'ancrage d'interface utilisateur, la navigation multi-étapes et l'utilisation d'outils visuels dans divers environnements numériques ?

MintAct est une famille de modèles vision-langage aux échelles 2B, 4B et 8B qui unifie l'ancrage d'interface utilisateur, la navigation multi-étapes sur mobile, bureau et Web, ainsi que l'utilisation d'outils visuels. Pour entraîner ces modèles, les auteurs ont développé un environnement évolutif et une infrastructure d'apprentissage par renforcement hébergeant des centaines d'instances concurrentes sur des backends hétérogènes. Un cadre asynchrone maintient le contrôle sur la distribution d'entraînement inter-domaines et reste stable face aux retours bruyants. Les résultats expérimentaux montrent que MintAct atteint des performances de pointe sur OSWorld-Verified avec un score de 48,9.

MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.

taesiri · 18 sept. 2026 lire l'original ↗
↑