RULER: Instance-aware Rubric Rewards for SVG Generation
Bài báo giới thiệu RULER (Instance-aware Rubric Rewards for Reinforcement Learning), một phương pháp chấm điểm dựa trên tiêu chí (rubric) để tối ưu hóa việc tạo mã Scalable Vector Graphics (SVG) thông qua học tăng cường. RULER tự động chuyển đổi mỗi hướng dẫn thành một rubric gồm sáu mục bao phủ các khía cạnh ngữ nghĩa, trực quan và phong cách. Một judge VLM chấm điểm từng mục trên các rollout được render, sau đó trọng số thỏa mãn được tối ưu hóa bằng Group Relative Policy Optimization. Kết quả trên MMSVG-Illustration và MMSVG-Icon cho thấy điểm rubric tăng đáng kể, vượt qua các chuyên gia SVG chuyên dụng và bắt kịp mô hình DeepSeek-V3 lớn hơn nhiều.
Prompt một VLM judge với rubric nhiều trục tương quan tốt hơn với phán đoán của con người so với các thang đo scalar.
RULER không yêu cầu dữ liệu SVG ground truth có cặp hoặc nhãn ưu tiên từ con người.
Trên MMSVG-Illustration và MMSVG-Icon, RULER nâng điểm rubric từ 0.432/0.395 lên 0.693/0.683.