Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence
CÂU HỎI — Làm thế nào để cải thiện việc giám sát các chuỗi suy luận ẩn (latent reasoning) trong các MLLM?
Bài báo nghiên cứu hành vi của token ẩn trong các MLLM và phát hiện ra hiện tượng "latent evidence-credit gap", trong đó các token ẩn phản hồi yếu với các thay đổi của hình ảnh. Để khắc phục, nhóm tác giả đề xuất khung ReaLVR, đưa việc giám sát bằng chứng thị giác vào các quỹ đạo ẩn chạy tự do của mô hình bằng cách so sánh câu trả lời đúng và sai do mô hình tạo ra. Phương pháp này giúp mô hình đạt điểm số cao trên Qwen2.5-VL-7B và có khả năng mở rộng lên quy mô mô hình lớn tới 235B.
Đạt điểm trung bình năm tác vụ cao nhất là 63,7% trên Qwen2.5-VL-7B.
Mở rộng thành công lập luận hình ảnh trong không gian ẩn lên quy mô mô hình biên lên tới 235B.
MarkShaw99 · 28 thg 9, 2026
đọc bản gốc ↗