CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — system_design 9 votes

Nereus: Adaptive Parallelism for LLM Post-Training

QUESTION — Comment un runtime adaptatif peut-il ajuster les plans d'exécution lors du post-entraînement par RL des LLM face à l'évolution des ressources ?

Cet article présente Nereus, un runtime conscient des coûts qui adapte les tâches de post-entraînement par RL des LLM en plans d'exécution efficaces sur clusters GPU. Nereus utilise un contrôleur à faible surcoût pour sélectionner des plans globaux viables en mémoire et gère les transitions à l'aide d'unités de modèles élastiques. Sur des traces réelles, l'adaptation TP/PP en ligne réduit la latence moyenne par étape de 27.7% par rapport à une disposition fixe. Sur une exécution de 1 000 étapes atteignant 1 024 GPU, six transitions consomment 0.079% du temps total, améliorant le débit PPO 8B de 2.14 à 7.27 fois par rapport à OpenRLHF.

L'adaptation TP/PP en ligne réduit la latence moyenne de 27.7% par rapport à la disposition fixe initiale avec mise à l'échelle DP.

Dans une exécution de 1 000 étapes atteignant 1 024 GPU, six transitions consomment 0.079% du temps d'exécution total.

Nereus améliore le débit PPO 8B de 2.14 à 7.27 fois par rapport à OpenRLHF et de 1.10 à 1.47 fois par rapport à Verl.

HollowMan6 · 28 sept. 2026 lire l'original ↗
↑