Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL
Bài báo chỉ ra rằng thuật toán GRPO trong học tăng cường cho code agent gán phần thưởng giống hệt nhau cho mọi trajectory vượt qua bài kiểm tra mà không phân biệt chất lượng thực thi. Để khắc phục, nhóm tác giả đề xuất GAGAR, một framework phân bổ lại tín hiệu thưởng nhận thức chất lượng. GAGAR giữ lại các nhóm chứa cả trajectory thành công và thất bại, đưa chúng vào một không gian chung để một agentic grader (được huấn luyện qua SFT) kiểm tra và xếp hạng. Sau đó, hệ thống giảm trọng số trajectory kém hơn và tỉ lệ hóa lại ưu thế của các trajectory đạt chuẩn nhằm bảo toàn tổng phần thưởng, giúp huấn luyện ổn định hơn và giảm tình trạng phình to độ dài trajectory trên các checkpoint MiMo-V2.6.
GAGAR giải quyết vấn đề phân bổ phần thưởng thô trong GRPO bằng cách đánh giá và xếp hạng chất lượng trajectory mã nguồn.
Khung GAGAR thực hiện phân bổ lại tín hiệu thưởng có bảo toàn tổng phần thưởng (sum-preserving redistribution).
Thực nghiệm quy mô lớn được thực hiện trên các checkpoint MiMo-V2.6-Flash (310B total parameters) và MiMo-V2.6-Pro (1.02T total parameters).