CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 49 votes

AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

QUESTION — Les générateurs d'images peuvent-ils servir de modèles du monde visuel pour synthétiser des trajectoires d'interaction pour les agents GUI ?

Les auteurs présentent AutoGUIWorld, un cadre de génération de données combinant les priors visuels de générateurs d'images avec la connaissance de tâches d'un planificateur pour synthétiser des trajectoires d'interaction GUI sans déployer de logiciels réels. Le cadre échantillonne des scènes GUI initiales à partir de spécifications de systèmes d'exploitation, spécifie des actions atomiques et édite itérativement des captures d'écran pour produire les observations suivantes. Le filtrage de qualité et l'ancrage des actions génèrent 79 266 échantillons d'entraînement au niveau des étapes annotés spatialement sur Ubuntu, Windows, macOS et Chrome. Le fine-tuning de Qwen3.5-35B-A3B améliore le score moyen sur OSWorld de 33,0 % à 40,8 % et le taux de succès sur ScienceBoard de 14,0 % à 32,2 %.

AutoGUIWorld produit 79 266 spatially annotated step-level training samples sur Ubuntu, Windows, macOS et Chrome.

Le fine-tuning de Qwen3.5-35B-A3B améliore le mean task score sur OSWorld de 33,0 % à 40,8 %.

Le fine-tuning de Qwen3.5-35B-A3B améliore le task success rate sur ScienceBoard de 14,0 % à 32,2 %.

YangC777 · 01 oct. 2026 lire l'original ↗
↑