CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 49 upvote

AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

CÂU HỎI — Liệu các trình tạo ảnh có thể đóng vai trò là mô hình thế giới thị giác để tổng hợp quỹ đạo cho GUI agent không?

Nhóm nghiên cứu giới thiệu AutoGUIWorld, một framework tạo dữ liệu kết hợp các prior thị giác từ trình tạo ảnh với tác vụ của một planner để tổng hợp quỹ đạo tương tác GUI mà không cần chạy môi trường phần mềm thực tế. Framework lấy mẫu cảnh GUI ban đầu từ thông số kỹ thuật của hệ điều hành, sau đó lập kế hoạch hành động và dùng trình tạo ảnh chỉnh sửa ảnh chụp màn hình hiện tại để tạo quan sát tiếp theo. Qua quá trình lọc chất lượng và căn chỉnh hành động, họ thu được 79.266 mẫu huấn luyện bước được chú thích không gian trên Ubuntu, Windows, macOS và Chrome. Kết quả cho thấy việc fine-tune Qwen3.5-35B-A3B cải thiện điểm số tác vụ trung bình trên OSWorld từ 33.0% lên 40.8% và trên ScienceBoard từ 14.0% lên 32.2%.

AutoGUIWorld tạo ra 79,266 spatially annotated step-level training samples trên Ubuntu, Windows, macOS và Chrome.

Fine-tuning Qwen3.5-35B-A3B cải thiện mean task score trên OSWorld từ 33.0% lên 40.8%.

Fine-tuning Qwen3.5-35B-A3B cải thiện task success rate trên ScienceBoard từ 14.0% lên 32.2%.

YangC777 · 01 thg 10, 2026 đọc bản gốc ↗
↑