Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
L'apprentissage par renforcement multi-récompense optimise simultanément plusieurs objectifs comportementaux, mais souffre souvent d'une progression d'apprentissage inégale en raison d'un déséquilibre des signaux. Cette étude analyse ce phénomène à travers l'énergie d'avantage pour montrer qu'elle est proportionnelle à la densité des groupes actifs sous la normalisation GDPO. Pour y remédier, les auteurs proposent l'agrégation de récompenses sensible à la densité (DARA), qui utilise une correction de densité par racine carrée inverse pour pondérer les signaux des récompenses moins fréquemment actives, accélérant ainsi l'apprentissage sur les tâches d'appel d'outils et de raisonnement mathématique.
DARA atteint une conformité de format élevée avec jusqu'à 26% d'étapes d'entraînement en moins sur l'appel d'outils.
DARA atteint une conformité de longueur presque saturée avec jusqu'à 65% d'étapes en moins sur le raisonnement mathématique.