CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — system_design 9 upvote

Nereus: Adaptive Parallelism for LLM Post-Training

CÂU HỎI — Làm thế nào để runtime tự động thích ứng với các thay đổi về tài nguyên và trạng thái phân tán trong quá trình hậu huấn luyện RL của LLM?

Nghiên cứu giới thiệu Nereus, một runtime nhận biết chi phí giúp thích ứng các tác vụ hậu huấn luyện tăng cường (RL) thành các kế hoạch thực thi hiệu quả trên các cụm GPU. Bộ điều khiển chi phí thấp của Nereus chọn các kế hoạch toàn cục khả thi về bộ nhớ và thực hiện chuyển đổi thông qua Elastic Model Unit và biểu đồ chuyển đổi toàn cục. Trên dữ liệu vết thực tế, việc thích ứng TP/PP trực tuyến giảm độ trễ bước trung bình 27.7% so với bố cục TP/PP cố định ban đầu có mở rộng DP. Trong một lượt chạy 1.000 bước đạt 1.024 GPU, sáu lần chuyển đổi chỉ tiêu tốn 0.079% tổng thời gian chạy, đồng thời cải thiện thông lượng PPO 8B từ 2.14--7.27 lần so với OpenRLHF và 1.10--1.47 lần so với Verl.

Online TP/PP adaptation giảm độ trễ bước trung bình 27.7% so với bố cục TP/PP cố định ban đầu với DP scaling trên dữ liệu vết thực tế.

Trong một lượt chạy 1.000 bước với 1.024 GPU, sáu lần chuyển đổi chỉ tiêu tốn 0.079% tổng thời gian chạy.

Nereus cải thiện thông lượng end-to-end 8B PPO từ 2.14--7.27 lần so với OpenRLHF và từ 1.10--1.47 lần so với Verl trên các cụm khác nhau.

HollowMan6 · 28 thg 9, 2026 đọc bản gốc ↗
↑