UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement
Nghiên cứu này giới thiệu UniEvo-VL, một framework tự tiến hóa dành cho các mô hình đa phương thức để học hỏi từ phản hồi tự sửa lỗi trong thời gian suy luận. Thay vì dựa vào một teacher bên ngoài lớn hơn, UniEvo-VL tận dụng chính các đánh giá phê bình của mô hình làm thông tin đặc quyền, với cùng một mô hình đóng vai trò cả teacher và student dựa trên các ngữ cảnh khác nhau. Quá trình huấn luyện giảm thiểu độ lệch trạng thái giữa các phân phối khuếch tán khử nhiễu trên các quỹ đạo lấy mẫu của student. Thực nghiệm trên Qwen-image-2512 cho thấy sự cải thiện đáng kể về khả năng tạo hình ảnh, tăng từ 0,747 lên 0,808 trên GenEval và từ 32,97 lên 35,53 trên GenEval2 Soft-TIFA.
UniEvo-VL cải thiện hiệu suất tạo hình ảnh của mô hình đa phương thức mà không cần giáo viên bên ngoài.
Điểm số trên GenEval tăng từ 0,747 lên 0,808.
Điểm số trên GenEval2 Soft-TIFA tăng từ 32,97 lên 35,53.