CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 18 upvote

Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

CÂU HỎI — Làm thế nào để huấn luyện đồng thời khả năng tự phản ánh (reflection) và tạo ảnh trong một mô hình đa phương thức hợp nhất thông qua học tăng cường?

Nhóm nghiên cứu giới thiệu UMM-Reflection, phương pháp áp dụng học tăng cường (RL) cho toàn bộ vòng lặp phản ánh và sửa lỗi hình ảnh trong một mô hình đa phương thức hợp nhất. Bằng cách sử dụng các quỹ đạo anh em (sibling trajectories) chia sẻ ảnh khởi tạo ban đầu, thuật toán áp dụng lợi thế tương đối theo nhóm và lợi thế theo cấp độ quỹ đạo để cập nhật đồng thời token phản ánh và các bản sửa đổi dựa trên luồng (flow-based revisions) mà không cần bộ chấm điểm độc lập tại thời điểm suy luận. Trên benchmark BAGEL, phương pháp này cải thiện GenEval thêm 12.05 điểm so với SFT, đồng thời chuyển giao tốt sang WISE (+10.97), OneIG-Bench (+3.48), và T2I-CompBench++ (+4.63).

Trên BAGEL, UMM-Reflection cải thiện GenEval thêm 12.05 điểm so với SFT.

Các mức cải thiện chuyển giao sang WISE (+10.97), OneIG-Bench (+3.48), và T2I-CompBench++ (+4.63).

Ziqi · 28 thg 9, 2026 đọc bản gốc ↗
↑