CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 101 upvote

RULER: Instance-aware Rubric Rewards for SVG Generation

CÂU HỎI — Làm thế nào để tối ưu hóa chính sách học tăng cường (RL) cho tác vụ tạo mã SVG mở mà không phụ thuộc vào dữ liệu ground truth hay nhãn ưu đãi của con người?

Bài báo giới thiệu RULER (Instance-aware Rubric Rewards for Reinforcement Learning), một phương pháp chấm điểm dựa trên tiêu chí (rubric) để tối ưu hóa việc tạo mã Scalable Vector Graphics (SVG) thông qua học tăng cường. RULER tự động chuyển đổi mỗi hướng dẫn thành một rubric gồm sáu mục bao phủ các khía cạnh ngữ nghĩa, trực quan và phong cách. Một judge VLM chấm điểm từng mục trên các rollout được render, sau đó trọng số thỏa mãn được tối ưu hóa bằng Group Relative Policy Optimization. Kết quả trên MMSVG-Illustration và MMSVG-Icon cho thấy điểm rubric tăng đáng kể, vượt qua các chuyên gia SVG chuyên dụng và bắt kịp mô hình DeepSeek-V3 lớn hơn nhiều.

Prompt một VLM judge với rubric nhiều trục tương quan tốt hơn với phán đoán của con người so với các thang đo scalar.

RULER không yêu cầu dữ liệu SVG ground truth có cặp hoặc nhãn ưu tiên từ con người.

Trên MMSVG-Illustration và MMSVG-Icon, RULER nâng điểm rubric từ 0.432/0.395 lên 0.693/0.683.

hangyuran · 21 thg 9, 2026 đọc bản gốc ↗
↑