ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
CÂU HỎI — Làm thế nào để tận dụng lại các rollout tự sinh lịch sử mà không cần sinh chính sách mới trong quá trình hậu huấn luyện LLM?
Các tác giả giới thiệu ROSS (Relearning from Self-Generated Rollouts through Selective Supervision), một phương pháp lưu giữ toàn bộ quỹ đạo lịch sử làm bối cảnh đồng thời chỉ áp dụng hàm mất mát cho các tiếp tuyến do mô hình sinh ra đã chọn lọc. Phương pháp này giải quyết vấn đề dữ liệu cũ bị loại bỏ hoặc chứa các sai sót. Trên mô hình Qwen3.6-35B-A3B, ROSS cải thiện điểm trung bình MOPD sáu benchmark từ 58.40% lên 62.20% và SWE-bench Verified từ 64.20% lên 68.40%. Kết quả cho thấy việc huấn luyện self-rollout để lại các kinh nghiệm hành vi có thể tái sử dụng thông qua SFT ngoại tuyến.
Trên Qwen3.6-35B-A3B, ROSS cải thiện điểm trung bình MOPD sáu benchmark từ 58.40% lên 62.20%.
ROSS cải thiện điểm SWE-bench Verified từ 64.20% lên 68.40%.
Hiiamein · 28 thg 9, 2026
đọc bản gốc ↗