AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
Nhóm nghiên cứu giới thiệu AutoGUIWorld, một framework tạo dữ liệu kết hợp các prior thị giác từ trình tạo ảnh với tác vụ của một planner để tổng hợp quỹ đạo tương tác GUI mà không cần chạy môi trường phần mềm thực tế. Framework lấy mẫu cảnh GUI ban đầu từ thông số kỹ thuật của hệ điều hành, sau đó lập kế hoạch hành động và dùng trình tạo ảnh chỉnh sửa ảnh chụp màn hình hiện tại để tạo quan sát tiếp theo. Qua quá trình lọc chất lượng và căn chỉnh hành động, họ thu được 79.266 mẫu huấn luyện bước được chú thích không gian trên Ubuntu, Windows, macOS và Chrome. Kết quả cho thấy việc fine-tune Qwen3.5-35B-A3B cải thiện điểm số tác vụ trung bình trên OSWorld từ 33.0% lên 40.8% và trên ScienceBoard từ 14.0% lên 32.2%.
AutoGUIWorld tạo ra 79,266 spatially annotated step-level training samples trên Ubuntu, Windows, macOS và Chrome.
Fine-tuning Qwen3.5-35B-A3B cải thiện mean task score trên OSWorld từ 33.0% lên 40.8%.
Fine-tuning Qwen3.5-35B-A3B cải thiện task success rate trên ScienceBoard từ 14.0% lên 32.2%.