CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 17 votes

Diffusion Reward Models

QUESTION — Comment les modèles de récompense peuvent-ils capturer la nature multimodale des préférences humaines au lieu de reposer sur des estimations ponctuelles ?

Les auteurs présentent DRM (Diffusion Reward Model), un modèle de récompense qui reformule la modélisation des récompenses en une estimation de densité conditionnelle. Conditionné par un encodeur LLM gelé, un transformateur de diffusion léger supprime le bruit gaussien pour obtenir un vecteur de récompense, représentant naturellement la structure multimodale. Sur cinq benchmarks, DRM égale ou dépasse les bases de référence et améliore les performances de politique en aval lors de l'entraînement RLHF.

hbx · 27 sept. 2026 lire l'original ↗
↑