CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 57 votes

Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

QUESTION — Comment surmonter le déséquilibre des signaux au niveau des lots dans l'apprentissage par renforcement multi-récompense pour les grands modèles de langage?

L'apprentissage par renforcement multi-récompense optimise simultanément plusieurs objectifs comportementaux, mais souffre souvent d'une progression d'apprentissage inégale en raison d'un déséquilibre des signaux. Cette étude analyse ce phénomène à travers l'énergie d'avantage pour montrer qu'elle est proportionnelle à la densité des groupes actifs sous la normalisation GDPO. Pour y remédier, les auteurs proposent l'agrégation de récompenses sensible à la densité (DARA), qui utilise une correction de densité par racine carrée inverse pour pondérer les signaux des récompenses moins fréquemment actives, accélérant ainsi l'apprentissage sur les tâches d'appel d'outils et de raisonnement mathématique.

DARA atteint une conformité de format élevée avec jusqu'à 26% d'étapes d'entraînement en moins sur l'appel d'outils.

DARA atteint une conformité de longueur presque saturée avec jusqu'à 65% d'étapes en moins sur le raisonnement mathématique.

zhaihaotian · 30 sept. 2026 lire l'original ↗
↑