CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 31 votes

CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

QUESTION — Comment empêcher les récompenses à grande échelle de dominer la normalisation et de supprimer les signaux provenant de récompenses à plus petite échelle dans l'optimisation de politique relative de groupe multi-récompense?

Nous proposons Correlation-Normalized GRPO (CorrGRPO), qui normalise les covariances par paires en coefficients de corrélation de Pearson pour l'apprentissage multi-récompense dans l'optimisation de politique relative de groupe. CorrGRPO maintient la récompense totale centrée inchangée tout en équilibrant l'influence de récompenses d'échelles différentes sur la normalisation basée sur la corrélation, empêchant les composants de récompense à grande échelle de dominer. Nous évaluons CorrGRPO sur la génération de code, l'appel d'outils et la sécurité des agents en utilisant des modèles allant de 0.5B à 8B paramètres.

CorrGRPO convertit les covariances par paires en coefficients de corrélation de Pearson pour équilibrer l'influence de récompenses d'échelles différentes.

La méthode est évaluée sur la génération de code, l'appel d'outils et la sécurité des agents en utilisant des modèles allant de 0.5B à 8B paramètres.

hubin · 29 sept. 2026 lire l'original ↗
↑