Selecting Diverse SFT Traces Improves Post-RL Generalization
Nghiên cứu này khảo sát tính đa dạng của đường dẫn lý luận (route diversity) trong dữ liệu supervised fine-tuning (SFT) để chuẩn bị cho mô hình lý luận bước vào reinforcement learning (RL). Nhóm tác giả đề xuất một bộ lọc dựa trên quy tắc, trọng lượng nhẹ và chỉ chạy trên CPU để chọn lọc các trình tự bước suy luận khác nhau từ một nhóm duy nhất. Kết quả thực nghiệm cho thấy việc chọn dữ liệu đa dạng về đường dẫn thay vì tương tự giúp cải thiện độ bao phủ bài toán sau RL trên các câu đố và toán học. Phương pháp này cung cấp tín hiệu học tập tốt hơn cho thuật toán RL dựa trên nhóm mà không cần gọi mô hình đắt đỏ.
Trong các thí nghiệm tổng hợp, SFT đa dạng hóa đường dẫn cải thiện pass@8 của OLMo3-7B thêm 16.9 điểm trên các môi trường giữ lại từ SFT.
Ở điều kiện một mô hình, việc chọn lọc đa dạng đạt được mức tăng trung bình lên tới 6.2 điểm cho chỉ số mean pass@8 qua 10 benchmark toán học.
Bộ lọc chỉ chạy trên CPU giúp vượt qua các lựa chọn thay thế tốn kém hơn trong mọi so sánh về hiệu suất trung bình sau RL trên 3 bộ ngữ liệu mã nguồn mở.