Bellman Policy Optimization
QUESTION — Comment améliorer les capacités de raisonnement des grands modèles de langage via l'apprentissage par renforcement avec des récompenses vérifiables sans estimer les valeurs des états intermédiaires ?
L'article présente Bellman Policy Optimization (BPO), une méthode sans critique dérivée du Policy Mirror Descent (PMD) pour l'apprentissage par renforcement avec des récompenses vérifiables (RLVR). Pour la génération autorégressive avec des récompenses terminales, BPO utilise les équations de Bellman pour reformuler le PMD en un objectif au niveau de la trajectoire, évitant ainsi d'estimer les valeurs des états intermédiaires. Les auteurs démontrent qu'il partage la même solution optimale unique que l'objectif PMD d'origine et dérivent une fonction de perte pratique dont le poids de correction d'inadéquation utilise un ratio lissé de probabilités de jetons complémentaires.
Mat3579 · 14 sept. 2026
lire l'original ↗