CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 101 votes

RULER: Instance-aware Rubric Rewards for SVG Generation

QUESTION — Comment optimiser les politiques d'apprentissage par renforcement pour la génération de code SVG ouverte sans dépendre de données de référence ou d'étiquettes de préférence humaine?

L'article présente RULER (Instance-aware Rubric Rewards for Reinforcement Learning), une approche de notation basée sur des critères pour optimiser la génération de code Scalable Vector Graphics (SVG) par apprentissage par renforcement. RULER convertit chaque instruction en une grille d'évaluation personnalisée de six éléments couvrant les axes sémantiques, visuels et stylistiques. Un modèle vision-langage évalue les rendus élément par élément, et les satisfactions pondérées sont optimisées via Group Relative Policy Optimization. Les résultats sur MMSVG-Illustration et MMSVG-Icon montrent une hausse sensible des scores, surpassant les spécialistes SVG dédiés et égalant DeepSeek-V3.

L'utilisation d'un juge vision-langage avec une grille multi-axe corrèle beaucoup mieux avec les jugements humains que les métriques scalaires.

RULER ne nécessite ni vérité terrain SVG appariée ni étiquettes de préférence humaine.

Sur MMSVG-Illustration et MMSVG-Icon, RULER fait passer le score de 0,432/0,395 à 0,693/0,683.

hangyuran · 21 sept. 2026 lire l'original ↗
↑