CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 31 votes

RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

QUESTION — Comment éliminer la dérive scalaire dans les modèles de récompense vidéo ?

L'article propose RewardVerse, un cadre de récompense vidéo basé sur des critères (rubric) conçu pour surmonter la dérive scalaire lors du mappage d'une qualité vidéo complexe en un seul score scalaire. Le cadre génère des critères d'évaluation explicites avant la notation, servant d'ancre sémantique stable. Ils introduisent Rubric-Guided Policy Optimization (RGPO), un algorithme d'entraînement en deux étapes qui réchauffe le scoreur et optimise conjointement le générateur de critères tout en s'alignant sur les évaluations humaines. Des expériences sur le benchmark EvalVerse à 16 dimensions démontrent que la méthode atténue la dérive scalaire et atteint des performances de pointe sur les évaluations ponctuelles et par paires.

RewardVerse introduit une grille d'évaluation dynamique comme représentation intermédiaire entre la requête d'évaluation et le scoreur pour atténuer la dérive scalaire.

EddieYang428 · 19 sept. 2026 lire l'original ↗
↑