PACT: From Credit Assignment to Critic Alignment
Bài báo giải quyết bài toán phân bổ phần thưởng ở cấp độ token trong reinforcement learning cho LLM thông qua việc xác định ba điều kiện quy chuẩn gồm Completeness, Prefix Consistency và Neutrality. Từ đó, tác giả đề xuất phương pháp Policy Aligned Critic Training (PACT), sử dụng thứ tự cập nhật Actor-then-Critic để căn chỉnh critic với policy. Kết quả thực nghiệm trên các bài toán lý luận toán học agentic và SWE-bench Verified cho thấy PACT vượt trội đáng kể so với các phương pháp chuẩn như GRPO và PPO.
Trong lý luận toán học dạng agentic, PACT đạt độ chính xác trung bình 72.87% trên bốn benchmark, vượt qua GRPO và PPO lần lượt là 8.80 và 13.16 điểm phần trăm.
Trên SWE-bench Verified, PACT đạt tỷ lệ vượt qua 67.4%, vượt trội hơn PPO, GRPO và SAO lần lượt là 2.4, 2.0 và 3.8 điểm phần trăm.