CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — system_design 12 upvote

QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

CÂU HỎI — Làm thế nào để giải quyết tình trạng lãng phí GPU và dư thừa quỹ đạo khi huấn luyện tăng cường trực tuyến cho các tác nhân có tầm nhìn siêu dài?

Các tác nhân ngôn ngữ lớn thực hiện các tác vụ có tầm nhìn cực dài thường tạo ra hàng trăm tương tác và hàng triệu token trên mỗi lượt chạy, gây ra hiện tượng nhàn rỗi GPU nghiêm trọng do chênh lệch thực thi và dư thừa quỹ đạo từ việc rẽ nhánh phi tuyến tính. Để giải quyết, nghiên cứu giới thiệu QwenGyre, một framework học tăng cường trực tuyến từ đầu đến cuối. QwenGyre phân bổ lại linh hoạt các GPU giữa giai đoạn chạy thử và huấn luyện mà không làm gián đoạn việc thực thi, đồng thời sử dụng bộ xử lý quỹ đạo để tái tạo lịch sử rẽ nhánh, chấm điểm tiến độ một phần và khử trùng lặp đường dẫn. Thực nghiệm trên mô hình Qwen~3.8 2.4T cho thấy mức cải thiện tuyệt đối trên NL2RepoBench và tốc độ vượt trội.

QwenGyre mang lại mức cải thiện tuyệt đối 6.0% trên NL2RepoBench từ 52.5% lên 58.5% trong 48 bước.

QwenGyre mang lại tốc độ nhanh hơn tới 1.85 lần so với phương pháp Colocate.

QwenGyre mang lại tốc độ nhanh hơn tới 1.78 lần so với phương pháp Async.

chenmouxiang · 27 thg 9, 2026 đọc bản gốc ↗
↑