CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 21 upvote

FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

CÂU HỎI — Làm thế nào để nén văn bản trực quan với độ phân giải thích ứng giúp giảm token mà vẫn giữ nguyên khả năng lý luận?

Nghiên cứu giới thiệu FocusVTC, giải quyết bài toán đánh đổi giữa độ phân giải và độ rõ nét trong visual text compression (VTC) thông qua độ phân giải thích ứng. Phương pháp kết hợp chế độ xem tổng quan độ phân giải thấp với việc tăng cường các vùng chọn lọc. Tác giả xây dựng bộ dữ liệu REL-CoT và áp dụng REL-SFT cùng Group Relative Policy Optimization. Kết quả cho thấy FocusVTC đạt tỉ lệ nén đầu vào 2.9times trên RULER v1, cải thiện điểm số LongBench và gia tăng tốc độ xử lý đầu cuối lên 2.79times so với văn bản thuần túy.

Đạt điểm số 87.4 tại mức nén đầu vào 2.9times trên RULER v1.

Vượt qua backbone đầu vào văn bản trên LongBench với điểm số 56.40 so với 55.86.

Đạt tốc độ xử lý đầu cuối nhanh hơn 2.79times so với Text và cải thiện điểm MMMU lên 66.73.

zfz04 · 29 thg 9, 2026 đọc bản gốc ↗
↑