CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 75 upvote

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

CÂU HỎI — Nguyên nhân cốt lõi nào dẫn đến hiện tượng Value Flattening trong thuật toán PPO khi huấn luyện mô hình ngôn ngữ lớn, và làm thế nào để khắc phục nó?

Các tác giả phát hiện ra một lỗi hệ thống trong các critic của thuật toán PPO gọi là Value Flattening, trong đó giá trị trạng thái từ Monte Carlo thay đổi mạnh mẽ trong khi dự đoán của critic lại phẳng lì. Phân tích chỉ ra rằng hiện tượng này bắt nguồn từ hình phạt phương sai ngầm trong hàm mất mát của critic và các cập nhật dư thừa từ các trạng thái tương quan thời gian. Để giải quyết vấn đề này, nhóm giới thiệu SParse Proximal Policy Optimization (SP^3O), áp dụng hàm mất mát giá trị cho một số ít trạng thái tách biệt rõ ràng trong mỗi phản hồi. Thử nghiệm trên Qwen3-Base cho thấy SP^3O với chỉ ba trạng thái được giám sát mỗi phản hồi có thể giảm thiểu Value Flattening và cải thiện chính sách học được qua nhiều kích cỡ mô hình.

Value Flattening là lỗi hệ thống khi giá trị trạng thái thay đổi mạnh nhưng dự đoán của critic vẫn phẳng.

SP^3O áp dụng hàm mất mát giá trị cho một số ít trạng thái tách biệt trong mỗi phản hồi để khắc phục vấn đề.

Thực nghiệm trên Qwen3-Base với chỉ ba trạng thái được giám sát mỗi phản hồi giúp cải thiện chính sách học được qua các kích cỡ mô hình.

ramiroluo · 16 thg 9, 2026 đọc bản gốc ↗
↑