CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 12 upvote

EasyPPO: Stabilizing the Critic Is Key

CÂU HỎI — Nguyên nhân nào từ mô hình đánh giá (critic) gây ra sự bất ổn định trong quá trình tối ưu hóa chính sách cận biên (PPO) cho mô hình ngôn ngữ lớn?

Bài báo chỉ ra rằng mô hình đánh giá (critic) là nguồn gốc chính gây bất ổn trong thuật toán PPO khi huấn luyện LLM thông qua hai dạng lỗi: việc lọc bỏ các rollout bị cắt cụt làm thiên lệch mục tiêu phần thưởng, và nhiễu lợi nhuận dị thể khiến các prompt có phương sai cao thống trị quá trình cập nhật. Để khắc phục, các tác giả đề xuất EasyPPO, bao gồm phương pháp lọc quá dài chỉ áp dụng cho actor, hồi quy critic chuẩn hóa theo nhiễu (noise-normalized critic regression) dựa trên nghịch đảo độ lệch chuẩn của phần thưởng mẫu, và thu nhỏ kích thước mini-batch của critic. Kết quả trên các bài toán FrontierCS, AIME24 và Search-R1 cho thấy EasyPPO duy trì sự ổn định suốt toàn bộ chu trình và mang lại mức cải thiện điểm xác thực tương ứng là 14.89%, 2.28% và 9.47% so với PPO thông thường.

Điểm xác thực tốt nhất của EasyPPO đạt mức cải thiện tương đối là 14.89% trên FrontierCS so với PPO.

EasyPPO đạt mức cải thiện tương đối 2.28% trên AIME24 so với PPO.

EasyPPO đạt mức cải thiện tương đối 9.47% trên Search-R1 so với PPO.

wchai · 29 thg 9, 2026 đọc bản gốc ↗
↑