On the Off-Policy Teacher in On-Policy Distillation
Nghiên cứu này giải quyết bất đối xứng trong on-policy distillation (OPD) nơi giáo viên phải giám sát các tiền tố do học sinh sinh ra, điều dẫn đến việc giảm sút chất lượng tiếp nối (continuation). Để giải quyết vấn đề này, tác giả đề xuất SCOUT (Student-COnditioned Updates of the Teacher), một khung đồng huấn luyện (co-training) thích nghi giáo viên với các tiền tố từ học sinh. Bên cạnh cập nhật OPD tiêu chuẩn, SCOUT định kỳ tối ưu hóa năng lực của giáo viên bằng reinforcement learning kết hợp phần thưởng có thể kiểm chứng (verifiable rewards). Các thí nghiệm có kiểm soát chứng minh rằng SCOUT cải thiện khả năng tiếp nối tiền tố của học sinh và nâng cao hiệu quả chưng cất trên nhiều cấu hình mô hình khác nhau.
SCOUT cải thiện khả năng của giáo viên trong việc tiếp tục sinh văn bản từ các tiền tố do học sinh tạo ra.
Khung đồng huấn luyện SCOUT kết hợp các cập nhật OPD tiêu chuẩn với reinforcement learning dựa trên phần thưởng có thể kiểm chứng.
SCOUT cải thiện nhất quán hiệu quả của on-policy distillation trên nhiều cấu hình teacher-student và lĩnh vực suy luận khác nhau.