On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
Nghiên cứu này đánh giá vai trò của chính sách rollout, hướng KL ở mức token và learning rate trong việc chưng cất mô hình strong-to-weak trên các họ mô hình Llama3 và Qwen2.5. Bằng cách thay đổi độc lập các yếu tố này trên các tác vụ khoa học, y tế và toán học, các tác giả phát hiện ra rằng chính sách rollout không đóng vai trò cốt lõi như quan niệm thông thường. Thay vào đó, hướng KL quyết định hiệu suất và độ phủ đầu ra, trong khi learning rate kiểm soát hiện tượng quên và độ thưa của tham số cập nhật. Forward KL thể hiện tính ổn định cao với mọi chính sách rollout, còn reverse KL nhạy cảm hơn và ưa chuộng rollout do học sinh sinh ra.
Forward KL exhibits exceptional robustness to rollout policy changes.
Reverse KL displays significantly higher sensitivity and prefers student-generated rollouts.
On-policy data improves generalisation to harder variants of the Countdown arithmetic task.