CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
Nghiên cứu đề xuất Correlation-Normalized GRPO (CorrGRPO), một phương pháp chuẩn hóa các hiệp phương sai theo cặp thành hệ số tương quan Pearson trong quá trình học nhiều phần thưởng của thuật toán GRPO. CorrGRPO giữ nguyên tổng phần thưởng đã được căn giữa đồng thời cân bằng ảnh hưởng của các phần thưởng có quy mô khác nhau đối với quá trình chuẩn hóa dựa trên tương quan, ngăn chặn việc các thành phần phần thưởng quy mô lớn áp đảo tín hiệu. Thử nghiệm trên việc tạo mã, gọi công cụ và bảo mật tác nhân với các mô hình từ 0.5B đến 8B tham số cho thấy CorrGRPO cải thiện hiệu suất trên cả ba miền.
CorrGRPO chuyển đổi các hiệp phương sai theo cặp thành hệ số tương quan Pearson để cân bằng ảnh hưởng của các phần thưởng có quy mô khác nhau.
Phương pháp được đánh giá trên các tác vụ tạo mã, gọi công cụ và bảo mật tác nhân bằng các mô hình từ 0.5B đến 8B tham số.