CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 75 votes

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

QUESTION — Quel est le mode de défaillance systématique connu sous le nom de Value Flattening dans les critiques PPO lors de l'apprentissage par renforcement des LLM, et comment l'atténuer ?

Les auteurs découvrent un mode de défaillance systématique dans les critiques PPO appelé Value Flattening, où les valeurs d'état estimées par Monte Carlo changent brusquement tandis que les prédictions du critique restent plates. Les analyses lient cela à une pénalité de variance implicite dans la perte du critique et à des mises à jour redondantes. Pour atténuer cela, ils introduisent SParse Proximal Policy Optimization (SP^3O), qui applique la perte de valeur à seulement quelques états bien séparés dans chaque réponse. Les expériences sur Qwen3-Base montrent que SP^3O avec seulement trois états supervisés par réponse atténue le Value Flattening et améliore la politique apprise.

Le Value Flattening est un mode de défaillance où les valeurs d'état changent brusquement tandis que les prédictions du critique restent plates.

SP^3O applique la perte de valeur à seulement quelques états bien séparés dans chaque réponse pour atténuer le problème.

Les expériences sur Qwen3-Base avec seulement trois états supervisés par réponse améliorent la politique apprise à travers les tailles de modèles.

ramiroluo · 16 sept. 2026 lire l'original ↗
↑