CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 144 upvote

The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation

CÂU HỎI — Làm thế nào để khắc phục sự bất ổn định trong quá trình ngoại suy không gian đầu ra của on-policy distillation?

Nghiên cứu này giải quyết vấn đề bất ổn định và suy giảm hiệu suất trong on-policy distillation (OPD) khi teacher ở gần với checkpoint cơ sở của nó. Các tác giả giới thiệu RIDE (RL-Induced Direction Extrapolation), một phương pháp ngoại suy sự thay đổi do học tăng cường gây ra trực tiếp trong không gian biểu diễn thay vì không gian đầu ra. Bằng cách tính toán phần dư giữa teacher và checkpoint trước RL ở mọi lớp và vị trí token, RIDE dịch chuyển trạng thái ẩn của student vượt quá teacher dọc theo phần dư này. Thực nghiệm trên bốn cặp teacher/base cho thấy RIDE luôn đạt hoặc vượt quá hiệu suất của teacher đã huấn luyện RL.

RIDE ngoại suy sự thay đổi do RL gây ra trực tiếp trong không gian biểu diễn ở mọi lớp và vị trí token.

Phương pháp này tương đương với việc tối đa hóa phần thưởng định hướng tuyến tính dưới hình phạt bậc hai tập trung vào teacher.

RIDE tiếp cận hoặc vượt qua teacher được huấn luyện RL trên mọi cặp mô hình được thử nghiệm.

LH2101 · 29 thg 9, 2026 đọc bản gốc ↗
↑