CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
Nous proposons Correlation-Normalized GRPO (CorrGRPO), qui normalise les covariances par paires en coefficients de corrélation de Pearson pour l'apprentissage multi-récompense dans l'optimisation de politique relative de groupe. CorrGRPO maintient la récompense totale centrée inchangée tout en équilibrant l'influence de récompenses d'échelles différentes sur la normalisation basée sur la corrélation, empêchant les composants de récompense à grande échelle de dominer. Nous évaluons CorrGRPO sur la génération de code, l'appel d'outils et la sécurité des agents en utilisant des modèles allant de 0.5B à 8B paramètres.
CorrGRPO convertit les covariances par paires en coefficients de corrélation de Pearson pour équilibrer l'influence de récompenses d'échelles différentes.
La méthode est évaluée sur la génération de code, l'appel d'outils et la sécurité des agents en utilisant des modèles allant de 0.5B à 8B paramètres.