CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 177 upvote

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

CÂU HỎI — Chính sách rollout, hướng KL ở mức token, và learning rate ảnh hưởng thế nào đến động lực chưng cất mô hình (distillation dynamics)?

Nghiên cứu này đánh giá vai trò của chính sách rollout, hướng KL ở mức token và learning rate trong việc chưng cất mô hình strong-to-weak trên các họ mô hình Llama3 và Qwen2.5. Bằng cách thay đổi độc lập các yếu tố này trên các tác vụ khoa học, y tế và toán học, các tác giả phát hiện ra rằng chính sách rollout không đóng vai trò cốt lõi như quan niệm thông thường. Thay vào đó, hướng KL quyết định hiệu suất và độ phủ đầu ra, trong khi learning rate kiểm soát hiện tượng quên và độ thưa của tham số cập nhật. Forward KL thể hiện tính ổn định cao với mọi chính sách rollout, còn reverse KL nhạy cảm hơn và ưa chuộng rollout do học sinh sinh ra.

Forward KL exhibits exceptional robustness to rollout policy changes.

Reverse KL displays significantly higher sensitivity and prefers student-generated rollouts.

On-policy data improves generalisation to harder variants of the Countdown arithmetic task.

jpiskorz · 28 thg 9, 2026 đọc bản gốc ↗
↑