CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 12 votes

EasyPPO: Stabilizing the Critic Is Key

QUESTION — Quels modes de défaillance liés au critique déstabilisent l'optimisation par politique proximale (PPO) lors de l'entraînement des grands modèles de langage ?

L'article identifie le critique comme une source majeure d'instabilité dans le PPO pour les LLM à travers deux modes de défaillance : le filtrage des rollouts tronqués déplace l'objectif de politique, et le bruit de rendement hétérogène permet aux invites à forte variance de dominer les mises à jour. Pour y remédier, les auteurs présentent EasyPPO, qui intègre un filtrage des rollouts trop longs uniquement pour l'acteur, une régression du critique normalisée par le bruit pondérant la perte par l'écart-type inverse des rendements échantillonnés, et des mini-lots de critique plus petits. Sur FrontierCS, AIME24 et Search-R1, EasyPPO reste stable tout au long de l'entraînement et surpasse le PPO standard avec des gains relatifs de score de validation de 14.89%, 2.28% et 9.47%.

Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 14.89% sur FrontierCS par rapport à PPO.

Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 2.28% sur AIME24 par rapport à PPO.

Les meilleurs scores de validation d'EasyPPO montrent des gains relatifs de 9.47% sur Search-R1 par rapport à PPO.

wchai · 29 sept. 2026 lire l'original ↗
↑