CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 55 upvote

RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

CÂU HỎI — Làm thế nào để huấn luyện các agent đa lượt bằng học tăng cường mà tránh được sự bất ổn từ thông tin đặc quyền của giáo viên?

Các agent đa lượt huấn luyện bằng học tăng cường thường sử dụng phương pháp chưng cất trực tuyến trên chính sách (OPD) với giáo viên mang kỹ năng đặc quyền để cung cấp giám sát ở cấp độ token. Tuy nhiên, thông tin đặc quyền không phải lúc nào cũng đáng tin cậy và lợi ích của giáo viên phụ thuộc vào từng giai đoạn huấn luyện. Nghiên cứu đề xuất RetireOPD (Self-Retiring On-Policy Distillation), tối ưu hóa một giáo viên có điều kiện kỹ năng trước, sau đó huấn luyện học sinh cùng với RL và OPD. Thông qua Adaptive Retirement, học sinh sẽ tự động loại bỏ giáo viên khi độ chênh lệch ngừng giảm và đạt đến một tỷ lệ thành công mục tiêu, sau đó tiếp tục huấn luyện thuần bằng RL. Trên các mô hình Qwen2.5 từ 1.5B đến 7B, RetireOPD cải thiện tỷ lệ thành công ALFWorld từ 14.1% lên 18.8% và độ chính xác WebShop từ 11.8% lên 19.0%.

RetireOPD áp dụng tính năng Adaptive Retirement để học sinh tự động loại bỏ giáo viên khi đạt đến tỷ lệ thành công mục tiêu.

Phương pháp này cải thiện tỷ lệ thành công trên ALFWorld từ 14,1% đến 18.8% so với baseline RL thuần túy trên các mô hình Qwen2.5 từ 1.5B đến 7B.

Độ chính xác trên WebShop được cải thiện từ 11.8% đến 19.0% và vượt qua chính giáo viên có điều kiện kỹ năng trong mọi thiết lập.

LZXzju · 17 thg 9, 2026 đọc bản gốc ↗
↑