CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 42 votes

Think Before You Score: Thinking Reward Model for Visual Generation

QUESTION — Comment améliorer les modèles de récompense visuelle en déterminant explicitement les critères d'évaluation au lieu d'effectuer un mappage direct vers des récompenses scalaires ?

Cet article présente le Thinking Reward Model (TRM) basé sur un paradigme de réflexion préalable, qui formule explicitement des grilles d'évaluation adaptées aux cas, effectue une évaluation guidée et produit des récompenses ponctuelles fines. Pour atténuer la polarisation des scores causée par l'optimisation conventionnelle des préférences par paires, les auteurs proposent l'optimisation de politique relative par paires à double groupe (PD-GRPO), qui exploite la supervision par paires pour améliorer la discrimination des récompenses tout en préservant la notation ponctuelle fine. Des expériences approfondies sur des benchmarks de génération et d'édition d'images montrent que TRM atteint des performances de pointe parmi les modèles de récompense open-source et optimise efficacement les modèles de génération visuelle en renforcement.

TRM atteint des performances de pointe parmi les modèles de récompense open-source sur les benchmarks de génération et d'édition d'images.

Le PD-GRPO exploite la supervision par paires pour améliorer la discrimination des récompenses tout en préservant la notation ponctuelle fine.

L'utilisation de TRM comme récompense pour l'apprentissage par renforcement améliore de manière cohérente divers modèles de génération visuelle.

DogNeverSleep · 29 sept. 2026 lire l'original ↗
↑