Region-Level Policy Optimization for Fine-grained MLLM Perception
Nghiên cứu này chỉ ra rằng định vị vùng quan tâm (RoI) và nhận diện nội dung trong các mô hình đa phương thức lớn (MLLM) có yêu cầu độ phân giải khác nhau, trong đó định vị chịu được việc nén token mạnh hơn khoảng 3 đến 4 lần. Để tối ưu hóa mạng đề xuất mà không phụ thuộc vào chú thích vùng, các tác giả giới thiệu Vision-RL2, một phương pháp học tăng cường cấp vùng coi các vùng liền mạch là hành động. Một trình đọc MLLM đóng băng đánh giá mức độ thay đổi xác suất câu trả lời khi loại bỏ mỗi vùng. Phương pháp này giúp tinh chỉnh bộ dự đoán để kích hoạt mã hóa thưa thớt, loại bỏ token nền. Kết quả trên sáu benchmark chi tiết và bốn kiến trúc MLLM cho thấy Vision-RL2 cải thiện độ chính xác với số lượng token thị giác ít hơn khoảng 4 lần.
Vision-RL2 vượt qua độ chính xác ở ngân sách lớn nhất của mô hình cơ sở với khoảng ít hơn 4 lần số token thị giác.