CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 31 upvote

CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

CÂU HỎI — Làm thế nào để ngăn chặn các phần thưởng có quy mô lớn làm lu mờ tín hiệu từ các phần thưởng có quy mô nhỏ hơn trong quá trình tối ưu hóa chính sách dựa trên nhóm (GRPO) với nhiều phần thưởng?

Nghiên cứu đề xuất Correlation-Normalized GRPO (CorrGRPO), một phương pháp chuẩn hóa các hiệp phương sai theo cặp thành hệ số tương quan Pearson trong quá trình học nhiều phần thưởng của thuật toán GRPO. CorrGRPO giữ nguyên tổng phần thưởng đã được căn giữa đồng thời cân bằng ảnh hưởng của các phần thưởng có quy mô khác nhau đối với quá trình chuẩn hóa dựa trên tương quan, ngăn chặn việc các thành phần phần thưởng quy mô lớn áp đảo tín hiệu. Thử nghiệm trên việc tạo mã, gọi công cụ và bảo mật tác nhân với các mô hình từ 0.5B đến 8B tham số cho thấy CorrGRPO cải thiện hiệu suất trên cả ba miền.

CorrGRPO chuyển đổi các hiệp phương sai theo cặp thành hệ số tương quan Pearson để cân bằng ảnh hưởng của các phần thưởng có quy mô khác nhau.

Phương pháp được đánh giá trên các tác vụ tạo mã, gọi công cụ và bảo mật tác nhân bằng các mô hình từ 0.5B đến 8B tham số.

hubin · 29 thg 9, 2026 đọc bản gốc ↗
↑