AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
Les auteurs présentent AutoGUIWorld, un cadre de génération de données combinant les priors visuels de générateurs d'images avec la connaissance de tâches d'un planificateur pour synthétiser des trajectoires d'interaction GUI sans déployer de logiciels réels. Le cadre échantillonne des scènes GUI initiales à partir de spécifications de systèmes d'exploitation, spécifie des actions atomiques et édite itérativement des captures d'écran pour produire les observations suivantes. Le filtrage de qualité et l'ancrage des actions génèrent 79 266 échantillons d'entraînement au niveau des étapes annotés spatialement sur Ubuntu, Windows, macOS et Chrome. Le fine-tuning de Qwen3.5-35B-A3B améliore le score moyen sur OSWorld de 33,0 % à 40,8 % et le taux de succès sur ScienceBoard de 14,0 % à 32,2 %.
AutoGUIWorld produit 79 266 spatially annotated step-level training samples sur Ubuntu, Windows, macOS et Chrome.
Le fine-tuning de Qwen3.5-35B-A3B améliore le mean task score sur OSWorld de 33,0 % à 40,8 %.
Le fine-tuning de Qwen3.5-35B-A3B améliore le task success rate sur ScienceBoard de 14,0 % à 32,2 %.