MintAct: A Unified Visual Agent for Digital Environments
MintAct est une famille de modèles vision-langage aux échelles 2B, 4B et 8B qui unifie l'ancrage d'interface utilisateur, la navigation multi-étapes sur mobile, bureau et Web, ainsi que l'utilisation d'outils visuels. Pour entraîner ces modèles, les auteurs ont développé un environnement évolutif et une infrastructure d'apprentissage par renforcement hébergeant des centaines d'instances concurrentes sur des backends hétérogènes. Un cadre asynchrone maintient le contrôle sur la distribution d'entraînement inter-domaines et reste stable face aux retours bruyants. Les résultats expérimentaux montrent que MintAct atteint des performances de pointe sur OSWorld-Verified avec un score de 48,9.
MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.