Calibrating Teacher--Student Discrepancy for On-Policy Distillation
Nghiên cứu này chỉ ra rằng sự chênh lệch token giữa giáo viên và học viên trong quá trình chưng cất on-policy (OPD) không chỉ phản ánh khoảng cách năng lực mà còn chứa các sai lệch xuất phát từ chính mô hình giáo viên. Để giải quyết vấn đề này, tác giả giới thiệu phương pháp Calibrated On-Policy Distillation (Cal-OPD), sử dụng các can thiệp có đặc quyền tích cực và tiêu cực để ước tính vùng tự sai lệch của giáo viên, từ đó chỉ giữ lại thành phần chênh lệch thực sự nằm ngoài vùng này. Kết quả thực nghiệm trên các benchmark suy luận toán học cho thấy Cal-OPD luôn vượt trội hơn OPD tiêu chuẩn ở mọi quy mô mô hình.
Cal-OPD chỉ giữ lại khoảng 52 đến 65 phần trăm độ lệch ban đầu giữa giáo viên và học viên làm tín hiệu tối ưu hóa.
Phương pháp này vượt trội hơn OPD tiêu chuẩn và các biến thể của nó trên mọi quy mô mô hình.
Được thử nghiệm và đánh giá trên các benchmark suy luận toán học.