CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 32 upvote

Region-Level Policy Optimization for Fine-grained MLLM Perception

CÂU HỎI — Làm thế nào để tối ưu hóa mạng đề xuất bằng học tăng cường cấp vùng nhằm cải thiện nhận thức hình ảnh chi tiết trong MLLM mà không làm tăng chi phí token?

Nghiên cứu này chỉ ra rằng định vị vùng quan tâm (RoI) và nhận diện nội dung trong các mô hình đa phương thức lớn (MLLM) có yêu cầu độ phân giải khác nhau, trong đó định vị chịu được việc nén token mạnh hơn khoảng 3 đến 4 lần. Để tối ưu hóa mạng đề xuất mà không phụ thuộc vào chú thích vùng, các tác giả giới thiệu Vision-RL2, một phương pháp học tăng cường cấp vùng coi các vùng liền mạch là hành động. Một trình đọc MLLM đóng băng đánh giá mức độ thay đổi xác suất câu trả lời khi loại bỏ mỗi vùng. Phương pháp này giúp tinh chỉnh bộ dự đoán để kích hoạt mã hóa thưa thớt, loại bỏ token nền. Kết quả trên sáu benchmark chi tiết và bốn kiến trúc MLLM cho thấy Vision-RL2 cải thiện độ chính xác với số lượng token thị giác ít hơn khoảng 4 lần.

Vision-RL2 vượt qua độ chính xác ở ngân sách lớn nhất của mô hình cơ sở với khoảng ít hơn 4 lần số token thị giác.

YuhengSSS · 17 thg 9, 2026 đọc bản gốc ↗
↑