CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 15 upvote

LastOPD: Taming Collapse in Latent On-Policy Distillation

CÂU HỎI — Làm thế nào để giải quyết hiện tượng sụp đổ trong quá trình chưng cất trực tuyến có sự giám sát tiềm ẩn?

Chưng cất trực tuyến kết hợp giám sát tiềm ẩn giúp căn chỉnh trạng thái tiềm ẩn của học sinh với giáo viên, nhưng thường gặp phải hiện tượng đạt đỉnh sớm rồi sụp đổ hoàn toàn về hiệu suất dù độ đo căn chỉnh vẫn cải thiện. Nguyên nhân là do sự lệch pha trong cách áp dụng tín hiệu tiềm ẩn giữa các mô hình có độ sâu khác nhau. Để khắc phục, nghiên cứu đề xuất LastOPD, áp dụng tín hiệu tiềm ẩn chỉ ở trạng thái lớp cuối cùng – giao diện chung của cả hai đầu mô hình ngôn ngữ – trong quá trình chuyển giao kéo dài 10 bước sang chưng cất cấp độ token. Thực nghiệm cho thấy LastOPD cải thiện điểm số trên tập MATH-500 so với phương pháp chỉ dùng token và đạt kết quả nhanh hơn.

Giám sát tiềm ẩn đơn lẻ nâng độ chính xác trên MATH-500 từ 25 lên 46 trong 10 bước nhưng việc huấn luyện tiếp theo làm giảm hiệu suất xuống 11 mà không thể phục hồi.

LastOPD cải thiện điểm số MATH-500 so với OPD chỉ dùng token thêm 5.55 và 4.02 điểm với các giáo viên 4B và 8B.

LastOPD đạt được điểm số cuối cùng của phương pháp OPD chỉ dùng token trong khoảng một nửa số bước huấn luyện.

Muyiiiii · 23 thg 9, 2026 đọc bản gốc ↗
↑