MintAct: A Unified Visual Agent for Digital Environments
MintAct là một dòng mô hình vision-language có quy mô 2B, 4B và 8B, hợp nhất việc định vị giao diện người dùng, điều hướng đa bước trên di động, máy tính để bàn và web, cùng với việc sử dụng công cụ trực quan. Để huấn luyện các mô hình này, các tác giả phát triển cơ sở hạ tầng môi trường và học tăng cường (RL) có khả năng mở rộng, lưu trữ hàng trăm phiên bản đồng thời trên các backend không đồng nhất. Khung làm việc bất đồng bộ duy trì sự kiểm soát đối với phân phối huấn luyện đa miền và ổn định trước nhiễu. Kết quả thực nghiệm cho thấy MintAct đạt hiệu suất state-of-the-art trên OSWorld-Verified với điểm số 48.9.
MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.