Scaling Properties of Same-Family On-Policy Distillation
Nghiên cứu này khảo sát các thuộc tính scaling của on-policy distillation (OPD) trong các thiết lập weak-to-strong, same-base và strong-to-weak. Các tác giả phát hiện ra rằng động lực huấn luyện OPD giai đoạn đầu tuân theo chế độ useful-transfer, nơi độ chính xác giữ lại tăng tuyến tính theo bình phương độ lệch KL ngược ở cấp độ token. Đáng chú ý, trong mọi cặp weak-to-strong, điểm số của student vượt qua cả teacher của nó. Nhóm nghiên cứu đã fit các power law để dự đoán kết quả OPD dựa trên số lượng tham số và điểm số của teacher, qua đó cho thấy các teacher nhỏ hơn nhưng có điểm số tương đương lại truyền tải năng lực tốt hơn.
Độ chính xác giữ lại tăng khoảng tuyến tính theo căn bậc hai của độ lệch KL ngược tính trên từng token trong chế độ useful-transfer.
Trong mọi cặp weak-to-strong được quan sát, điểm số vàng đỉnh cao của student vượt qua cả teacher của chính nó.
Điểm số vàng đỉnh cao cải thiện theo quy mô của teacher chỉ đến khoảng quy mô của student.