CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 48 votes

Bellman Policy Optimization

QUESTION — Comment améliorer les capacités de raisonnement des grands modèles de langage via l'apprentissage par renforcement avec des récompenses vérifiables sans estimer les valeurs des états intermédiaires ?

L'article présente Bellman Policy Optimization (BPO), une méthode sans critique dérivée du Policy Mirror Descent (PMD) pour l'apprentissage par renforcement avec des récompenses vérifiables (RLVR). Pour la génération autorégressive avec des récompenses terminales, BPO utilise les équations de Bellman pour reformuler le PMD en un objectif au niveau de la trajectoire, évitant ainsi d'estimer les valeurs des états intermédiaires. Les auteurs démontrent qu'il partage la même solution optimale unique que l'objectif PMD d'origine et dérivent une fonction de perte pratique dont le poids de correction d'inadéquation utilise un ratio lissé de probabilités de jetons complémentaires.

Mat3579 · 14 sept. 2026 lire l'original ↗
↑