An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning
Nghiên cứu này khảo sát on-policy distillation (OPD) thông qua lăng kính reinforcement learning và kết nối hàm mục tiêu reverse-KL với KL-regularized policy optimization. Nhóm tác giả giới thiệu Least-Square Policy Distillation (LSPD), một framework tích hợp sự khám phá lạc quan (optimistic exploration) và việc tái sử dụng dữ liệu off-policy từ giá trị của RL vào quá trình chưng cất chính sách. LSPD duy trì sự đa dạng của chính sách và nâng cao hiệu quả rollout bằng cách học hỏi liên tục từ các trajectory đã thu thập. Kết quả thực nghiệm trên sáu benchmark toán học cho thấy LSPD đạt mức cải thiện trung bình +1.59 điểm ở chỉ số Avg@16 và phiên bản off-policy hoàn toàn đạt hiệu năng tương đương OPD thông thường chỉ với 25% số batch rollout đầu tiên.
LSPD đạt mức cải thiện trung bình +1.59 điểm ở chỉ số Avg@16 trên sáu benchmark toán học.
Công thức lý tưởng của LSPD đạt được biên giới hối tiếc mathcal O(log K) dưới sự khám phá trực tuyến.
Biến thể off-policy hoàn toàn của LSPD đạt hiệu năng tương đương OPD thông thường chỉ với 25% số batch rollout đầu tiên.