CONSONANCE.for your information
Monday, 5 October 2026frenvi

Worth reading closely

01 — training 42 upvotes

Think Before You Score: Thinking Reward Model for Visual Generation

QUESTION — How can visual reward models be improved by explicitly determining evaluation criteria instead of mapping directly to scalar rewards?

This paper introduces the Thinking Reward Model (TRM) based on a 'Think Before You Score' paradigm, which explicitly formulates case-adaptive rubrics, performs rubric-guided assessment, and produces fine-grained pointwise rewards. To mitigate score polarization caused by conventional pairwise preference optimization, the authors propose Pairwise Dual-Group Relative Policy Optimization (PD-GRPO), which leverages pairwise supervision to improve reward discrimination while preserving fine-grained pointwise scoring. Extensive experiments on image generation and editing benchmarks show that TRM achieves state-of-the-art performance among open-source reward models and effectively optimizes visual generation models when used in reinforcement learning.

TRM achieves state-of-the-art performance among open-source reward models on image generation and editing benchmarks.

PD-GRPO leverages pairwise supervision to improve reward discrimination while preserving fine-grained pointwise scoring.

Using TRM as a reward for reinforcement learning consistently improves diverse visual generation models.

DogNeverSleep · 29 Sept 2026 read the original ↗
↑