Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
Các tác giả phát hiện ra một lỗi hệ thống trong các critic của thuật toán PPO gọi là Value Flattening, trong đó giá trị trạng thái từ Monte Carlo thay đổi mạnh mẽ trong khi dự đoán của critic lại phẳng lì. Phân tích chỉ ra rằng hiện tượng này bắt nguồn từ hình phạt phương sai ngầm trong hàm mất mát của critic và các cập nhật dư thừa từ các trạng thái tương quan thời gian. Để giải quyết vấn đề này, nhóm giới thiệu SParse Proximal Policy Optimization (SP^3O), áp dụng hàm mất mát giá trị cho một số ít trạng thái tách biệt rõ ràng trong mỗi phản hồi. Thử nghiệm trên Qwen3-Base cho thấy SP^3O với chỉ ba trạng thái được giám sát mỗi phản hồi có thể giảm thiểu Value Flattening và cải thiện chính sách học được qua nhiều kích cỡ mô hình.
Value Flattening là lỗi hệ thống khi giá trị trạng thái thay đổi mạnh nhưng dự đoán của critic vẫn phẳng.
SP^3O áp dụng hàm mất mát giá trị cho một số ít trạng thái tách biệt trong mỗi phản hồi để khắc phục vấn đề.
Thực nghiệm trên Qwen3-Base với chỉ ba trạng thái được giám sát mỗi phản hồi giúp cải thiện chính sách học được qua các kích cỡ mô hình.