CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 19 upvote

Rufus-Air: An Open LLM Post-Training Recipe

CÂU HỎI — Làm thế nào để xây dựng một post-training recipe tái lập được cho mô hình cơ sở 106B-A12B bằng pipeline nối tiếp tám giai đoạn?

Nhóm tác giả giới thiệu Rufus-Air, một quy trình post-training mở gồm tám giai đoạn nối tiếp trên nền mô hình GLM-4.5-Air-Base (106B-A12B), từ SFT và các loại RL chuyên biệt cho đến RLHF. Phương pháp này sắp xếp các giai đoạn theo độ khó tăng dần và độ tin cậy của phần thưởng, sử dụng dữ liệu công khai mà không cần tạo chú thích thủ công mới hay dùng mô hình distillation teacher nội bộ. Kết quả cho thấy Rufus-Air vượt trội hơn bản phát hành post-training chính thức của GLM-4.5-Air và cạnh tranh tốt với các mô hình mở có cùng kích thước.

Diverse, high-quality SFT establishes a strong capability floor.

Difficulty filtering keeps RL prompts within a productive learning range.

Reward reliability provides a practical principle for ordering stages.

lawhy · 24 thg 9, 2026 đọc bản gốc ↗
↑