CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 12 upvote

Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models

CÂU HỎI — Liệu có thể giữ nguyên toàn bộ visual token trong MLLM mà vẫn giảm được chi phí tính toán khi Transformer xử lý lặp lại các biểu diễn hình ảnh hay không?

Nhóm tác giả nghiên cứu cách tối ưu hóa các mô hình ngôn ngữ đa phương thức (MLLM) bằng cách can thiệp vào dòng thông tin từ hình ảnh sang văn bản ở cấp độ low-rank. Họ phát hiện ra rằng ảnh hưởng của thị giác tập trung trong một subspace có chiều thấp, và các MLP nhẹ có thể xấp xỉ các trạng thái hình ảnh theo từng layer với độ chính xác cao. Phương pháp đề xuất mang tên δ-Vision thay thế việc xử lý lặp qua Transformer bằng các adapter low-rank nhẹ, giúp xây dựng bộ nhớ hình ảnh theo từng layer nhưng vẫn giữ lại toàn bộ visual token phục vụ cho việc truy xuất văn bản.

Khôi phục chỉ một vài hướng sau khi chặn attention giữa hình ảnh và văn bản giúp thu hồi phần lớn độ chính xác bị mất.

Các MLP nhẹ xấp xỉ trạng thái hình ảnh theo layer với cosine similarity cao và reconstruction error thấp.

δ-Vision đạt độ chính xác cao hơn các baseline pruning visual token ở mức tính toán tương đương hoặc thấp hơn.

huaXiaKyrie · 28 thg 9, 2026 đọc bản gốc ↗
↑