CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — multimodal 80 upvote

UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

CÂU HỎI — Làm thế nào để cải thiện các mô hình đa phương thức thông qua quá trình tự phản hồi trong thời gian suy luận mà không cần giáo viên bên ngoài?

Nghiên cứu này giới thiệu UniEvo-VL, một framework tự tiến hóa dành cho các mô hình đa phương thức để học hỏi từ phản hồi tự sửa lỗi trong thời gian suy luận. Thay vì dựa vào một teacher bên ngoài lớn hơn, UniEvo-VL tận dụng chính các đánh giá phê bình của mô hình làm thông tin đặc quyền, với cùng một mô hình đóng vai trò cả teacher và student dựa trên các ngữ cảnh khác nhau. Quá trình huấn luyện giảm thiểu độ lệch trạng thái giữa các phân phối khuếch tán khử nhiễu trên các quỹ đạo lấy mẫu của student. Thực nghiệm trên Qwen-image-2512 cho thấy sự cải thiện đáng kể về khả năng tạo hình ảnh, tăng từ 0,747 lên 0,808 trên GenEval và từ 32,97 lên 35,53 trên GenEval2 Soft-TIFA.

UniEvo-VL cải thiện hiệu suất tạo hình ảnh của mô hình đa phương thức mà không cần giáo viên bên ngoài.

Điểm số trên GenEval tăng từ 0,747 lên 0,808.

Điểm số trên GenEval2 Soft-TIFA tăng từ 32,97 lên 35,53.

fangwu97 · 30 thg 9, 2026 đọc bản gốc ↗
↑