CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 25 upvote

LoopVL: Recurrent Visual Intelligence

CÂU HỎI — Liệu Loop Transformers có thể mở rộng hiệu quả sang các mô hình ngôn ngữ thị giác để xử lý tính toán hồi quy không?

Nhóm nghiên cứu giới thiệu LoopVL để nghiên cứu việc mở rộng Loop Transformers sang các mô hình ngôn ngữ-hình ảnh (VLM). LoopVL kết hợp tính toán Module-Loop và Model-Loop nhằm cập nhật lặp đi lặp lại trạng thái ngôn ngữ-hình ảnh thống nhất thông qua các module được chia sẻ. Mô hình được huấn luyện từ đầu qua ba giai đoạn: tiền huấn luyện ngôn ngữ, huấn luyện đa phương thức và hậu huấn luyện. Kết quả cho thấy LoopVL vượt qua nhiều mô hình không hồi quy có kích thước tương đương hoặc lớn hơn trên các benchmark hiểu đa phương thức và suy luận thị giác, đồng thời biểu hiện hiện tượng Visual Aha Moments với sự thay đổi chú ý rõ rệt qua các vòng lặp.

Gtime666 · 29 thg 9, 2026 đọc bản gốc ↗
↑