EasyPPO: Stabilizing the Critic Is Key
L'article identifie le critique comme une source majeure d'instabilité dans le PPO pour les LLM à travers deux modes de défaillance : le filtrage des rollouts tronqués déplace l'objectif de politique, et le bruit de rendement hétérogène permet aux invites à forte variance de dominer les mises à jour. Pour y remédier, les auteurs présentent EasyPPO, qui intègre un filtrage des rollouts trop longs uniquement pour l'acteur, une régression du critique normalisée par le bruit pondérant la perte par l'écart-type inverse des rendements échantillonnés, et des mini-lots de critique plus petits. Sur FrontierCS, AIME24 et Search-R1, EasyPPO reste stable tout au long de l'entraînement et surpasse le PPO standard avec des gains relatifs de score de validation de 14.89%, 2.28% et 9.47%.
Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 14.89% sur FrontierCS par rapport à PPO.
Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 2.28% sur AIME24 par rapport à PPO.
Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 9.47% sur Search-R1 par rapport à PPO.