Think Before You Score: Thinking Reward Model for Visual Generation
Cet article présente le Thinking Reward Model (TRM) basé sur un paradigme de réflexion préalable, qui formule explicitement des grilles d'évaluation adaptées aux cas, effectue une évaluation guidée et produit des récompenses ponctuelles fines. Pour atténuer la polarisation des scores causée par l'optimisation conventionnelle des préférences par paires, les auteurs proposent l'optimisation de politique relative par paires à double groupe (PD-GRPO), qui exploite la supervision par paires pour améliorer la discrimination des récompenses tout en préservant la notation ponctuelle fine. Des expériences approfondies sur des benchmarks de génération et d'édition d'images montrent que TRM atteint des performances de pointe parmi les modèles de récompense open-source et optimise efficacement les modèles de génération visuelle en renforcement.
TRM atteint des performances de pointe parmi les modèles de récompense open-source sur les benchmarks de génération et d'édition d'images.
Le PD-GRPO exploite la supervision par paires pour améliorer la discrimination des récompenses tout en préservant la notation ponctuelle fine.
L'utilisation de TRM comme récompense pour l'apprentissage par renforcement améliore de manière cohérente divers modèles de génération visuelle.