Towards Full Pipeline FP8 Reinforcement Learning for LLMs
Cet article identifie que l'instabilité de l'apprentissage par renforcement (RL) en FP8 à pipeline complet provient du bruit de quantification FP8 cumulé qui distord les rapports d'importance, annulant par erreur les gradients des tokens à avantage négatif. Pour résoudre ce problème, les auteurs proposent le Calibrated Clipping, une méthode dynamique qui aligne les limites de rognage FP8 avec les distributions BF16 de haute précision. Des expériences sur les algorithmes GRPO et DAPO avec des échelles de modèles de 8B à 32B montrent que cette approche élimine les hausses d'entropie et égale les performances du BF16.
Le bruit de quantification FP8 cumulé fausse le rapport d'importance, poussant les jetons à avantage négatif hors de la région de confiance et annulant leurs gradients.
Le rognage calibré (Calibrated Clipping) est proposé comme méthode dynamique alignant les limites de rognage FP8 avec les distributions BF16 de haute précision.
Les expériences menées sur les algorithmes GRPO et DAPO, avec des échelles de modèles de 8B à 32B, éliminent avec succès les pics d'entropie et restaurent des performances comparables à celles du BF16.