Nereus: Adaptive Parallelism for LLM Post-Training
Cet article présente Nereus, un runtime conscient des coûts qui adapte les tâches de post-entraînement par RL des LLM en plans d'exécution efficaces sur clusters GPU. Nereus utilise un contrôleur à faible surcoût pour sélectionner des plans globaux viables en mémoire et gère les transitions à l'aide d'unités de modèles élastiques. Sur des traces réelles, l'adaptation TP/PP en ligne réduit la latence moyenne par étape de 27.7% par rapport à une disposition fixe. Sur une exécution de 1 000 étapes atteignant 1 024 GPU, six transitions consomment 0.079% du temps total, améliorant le débit PPO 8B de 2.14 à 7.27 fois par rapport à OpenRLHF.
L'adaptation TP/PP en ligne réduit la latence moyenne de 27.7% par rapport à la disposition fixe initiale avec mise à l'échelle DP.
Dans une exécution de 1 000 étapes atteignant 1 024 GPU, six transitions consomment 0.079% du temps d'exécution total.
Nereus améliore le débit PPO 8B de 2.14 à 7.27 fois par rapport à OpenRLHF et de 1.10 à 1.47 fois par rapport à Verl.