CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 111 upvote

Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

CÂU HỎI — How to redistribute credit in code agent reinforcement learning to favor clean, targeted implementations over those containing unnecessary changes?

Bài báo chỉ ra rằng thuật toán GRPO trong học tăng cường cho code agent gán phần thưởng giống hệt nhau cho mọi trajectory vượt qua bài kiểm tra mà không phân biệt chất lượng thực thi. Để khắc phục, nhóm tác giả đề xuất GAGAR, một framework phân bổ lại tín hiệu thưởng nhận thức chất lượng. GAGAR giữ lại các nhóm chứa cả trajectory thành công và thất bại, đưa chúng vào một không gian chung để một agentic grader (được huấn luyện qua SFT) kiểm tra và xếp hạng. Sau đó, hệ thống giảm trọng số trajectory kém hơn và tỉ lệ hóa lại ưu thế của các trajectory đạt chuẩn nhằm bảo toàn tổng phần thưởng, giúp huấn luyện ổn định hơn và giảm tình trạng phình to độ dài trajectory trên các checkpoint MiMo-V2.6.

GAGAR giải quyết vấn đề phân bổ phần thưởng thô trong GRPO bằng cách đánh giá và xếp hạng chất lượng trajectory mã nguồn.

Khung GAGAR thực hiện phân bổ lại tín hiệu thưởng có bảo toàn tổng phần thưởng (sum-preserving redistribution).

Thực nghiệm quy mô lớn được thực hiện trên các checkpoint MiMo-V2.6-Flash (310B total parameters) và MiMo-V2.6-Pro (1.02T total parameters).

whatseeker · 26 thg 9, 2026 đọc bản gốc ↗
↑