CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 19 upvote

MintAct: A Unified Visual Agent for Digital Environments

CÂU HỎI — Làm thế nào để huấn luyện một mô hình vision-language đồng nhất hỗ trợ định vị UI, điều hướng đa bước và sử dụng công cụ trực quan qua các môi trường số khác nhau?

MintAct là một dòng mô hình vision-language có quy mô 2B, 4B và 8B, hợp nhất việc định vị giao diện người dùng, điều hướng đa bước trên di động, máy tính để bàn và web, cùng với việc sử dụng công cụ trực quan. Để huấn luyện các mô hình này, các tác giả phát triển cơ sở hạ tầng môi trường và học tăng cường (RL) có khả năng mở rộng, lưu trữ hàng trăm phiên bản đồng thời trên các backend không đồng nhất. Khung làm việc bất đồng bộ duy trì sự kiểm soát đối với phân phối huấn luyện đa miền và ổn định trước nhiễu. Kết quả thực nghiệm cho thấy MintAct đạt hiệu suất state-of-the-art trên OSWorld-Verified với điểm số 48.9.

MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.

taesiri · 18 thg 9, 2026 đọc bản gốc ↗
↑