CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 9 upvote

Program-Verified Self-Evolution for Vision-Language Models

CÂU HỎI — Làm thế nào để loại bỏ các nhãn sai do phương pháp majority vote hoặc model judge tạo ra trong quá trình self-evolution của mô hình thị giác-ngôn ngữ?

Nhóm tác giả đề xuất Verifiable QA Generation for Self-Evolving Models (VQS) nhằm giải quyết vấn đề nhãn sai phổ biến trong quá trình self-evolution của các mô hình vision-language (VLM). Thay vì dùng voting trực tiếp trên câu trả lời, VQS phân tích hình ảnh thành các bản ghi có cấu trúc (như scene graph hoặc bảng biểu), sau đó sử dụng các chương trình cố định để sinh câu hỏi và tính toán đáp án. Mô hình chỉ đóng vai trò kiểm tra từng sự kiện nhỏ độc lập. Phương pháp này nâng cao đáng kể tỷ lệ câu trả lời đúng và cải thiện hiệu năng của Qwen3-VL qua các vòng huấn luyện.

24% majority-vote labels và 18% model-judge labels được tạo ra trong quá trình self-evolution là sai.

Human raters tìm thấy 94% VQS answers chính xác, so với 76% của majority voting.

VQS cải thiện Qwen3-VL lên tới 3.18 điểm tại các scale 2B, 4B và 8B trên mười benchmark.

ahmedheakl · 27 thg 9, 2026 đọc bản gốc ↗
↑