Rufus-Air: An Open LLM Post-Training Recipe
CÂU HỎI — Làm thế nào để xây dựng một post-training recipe tái lập được cho mô hình cơ sở 106B-A12B bằng pipeline nối tiếp tám giai đoạn?
Nhóm tác giả giới thiệu Rufus-Air, một quy trình post-training mở gồm tám giai đoạn nối tiếp trên nền mô hình GLM-4.5-Air-Base (106B-A12B), từ SFT và các loại RL chuyên biệt cho đến RLHF. Phương pháp này sắp xếp các giai đoạn theo độ khó tăng dần và độ tin cậy của phần thưởng, sử dụng dữ liệu công khai mà không cần tạo chú thích thủ công mới hay dùng mô hình distillation teacher nội bộ. Kết quả cho thấy Rufus-Air vượt trội hơn bản phát hành post-training chính thức của GLM-4.5-Air và cạnh tranh tốt với các mô hình mở có cùng kích thước.
Diverse, high-quality SFT establishes a strong capability floor.
Difficulty filtering keeps RL prompts within a productive learning range.
Reward reliability provides a practical principle for ordering stages.
lawhy · 24 thg 9, 2026
đọc bản gốc ↗