CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 10 upvote

On the Off-Policy Teacher in On-Policy Distillation

CÂU HỎI — Làm thế nào để khắc phục hiện tượng suy giảm hiệu năng của giáo viên khi thực hiện giám sát các tiền tố do học sinh tạo ra trong on-policy distillation?

Nghiên cứu này giải quyết bất đối xứng trong on-policy distillation (OPD) nơi giáo viên phải giám sát các tiền tố do học sinh sinh ra, điều dẫn đến việc giảm sút chất lượng tiếp nối (continuation). Để giải quyết vấn đề này, tác giả đề xuất SCOUT (Student-COnditioned Updates of the Teacher), một khung đồng huấn luyện (co-training) thích nghi giáo viên với các tiền tố từ học sinh. Bên cạnh cập nhật OPD tiêu chuẩn, SCOUT định kỳ tối ưu hóa năng lực của giáo viên bằng reinforcement learning kết hợp phần thưởng có thể kiểm chứng (verifiable rewards). Các thí nghiệm có kiểm soát chứng minh rằng SCOUT cải thiện khả năng tiếp nối tiền tố của học sinh và nâng cao hiệu quả chưng cất trên nhiều cấu hình mô hình khác nhau.

SCOUT cải thiện khả năng của giáo viên trong việc tiếp tục sinh văn bản từ các tiền tố do học sinh tạo ra.

Khung đồng huấn luyện SCOUT kết hợp các cập nhật OPD tiêu chuẩn với reinforcement learning dựa trên phần thưởng có thể kiểm chứng.

SCOUT cải thiện nhất quán hiệu quả của on-policy distillation trên nhiều cấu hình teacher-student và lĩnh vực suy luận khác nhau.

shrango · 29 thg 9, 2026 đọc bản gốc ↗
↑