Diffusion Reward Models
QUESTION — Comment les modèles de récompense peuvent-ils capturer la nature multimodale des préférences humaines au lieu de reposer sur des estimations ponctuelles ?
Les auteurs présentent DRM (Diffusion Reward Model), un modèle de récompense qui reformule la modélisation des récompenses en une estimation de densité conditionnelle. Conditionné par un encodeur LLM gelé, un transformateur de diffusion léger supprime le bruit gaussien pour obtenir un vecteur de récompense, représentant naturellement la structure multimodale. Sur cinq benchmarks, DRM égale ou dépasse les bases de référence et améliore les performances de politique en aval lors de l'entraînement RLHF.
hbx · 27 sept. 2026
lire l'original ↗