CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 24 upvote

Selecting Diverse SFT Traces Improves Post-RL Generalization

CÂU HỎI — Tính đa dạng của đường dẫn lý luận trong dữ liệu SFT ảnh hưởng như thế nào đến khả năng tổng quát hóa sau quá trình huấn luyện RL?

Nghiên cứu này khảo sát tính đa dạng của đường dẫn lý luận (route diversity) trong dữ liệu supervised fine-tuning (SFT) để chuẩn bị cho mô hình lý luận bước vào reinforcement learning (RL). Nhóm tác giả đề xuất một bộ lọc dựa trên quy tắc, trọng lượng nhẹ và chỉ chạy trên CPU để chọn lọc các trình tự bước suy luận khác nhau từ một nhóm duy nhất. Kết quả thực nghiệm cho thấy việc chọn dữ liệu đa dạng về đường dẫn thay vì tương tự giúp cải thiện độ bao phủ bài toán sau RL trên các câu đố và toán học. Phương pháp này cung cấp tín hiệu học tập tốt hơn cho thuật toán RL dựa trên nhóm mà không cần gọi mô hình đắt đỏ.

Trong các thí nghiệm tổng hợp, SFT đa dạng hóa đường dẫn cải thiện pass@8 của OLMo3-7B thêm 16.9 điểm trên các môi trường giữ lại từ SFT.

Ở điều kiện một mô hình, việc chọn lọc đa dạng đạt được mức tăng trung bình lên tới 6.2 điểm cho chỉ số mean pass@8 qua 10 benchmark toán học.

Bộ lọc chỉ chạy trên CPU giúp vượt qua các lựa chọn thay thế tốn kém hơn trong mọi so sánh về hiệu suất trung bình sau RL trên 3 bộ ngữ liệu mã nguồn mở.

shizhuo2 · 27 thg 9, 2026 đọc bản gốc ↗
↑