CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 13 votes

Learning to Solve Hard Problems in RL for LLMs by Never Giving Up

QUESTION — Comment adapter l'apprentissage par renforcement pour les grands modèles de langage afin d'améliorer les performances sur les problèmes difficiles sans gaspiller de calcul sur les problèmes faciles ?

Cet article met en évidence l'effet Matthieu dans l'apprentissage par renforcement (RL) pour les LLM, où le RL privilégie nettement les problèmes faciles au détriment des problèmes difficiles. Pour résoudre ce problème, les auteurs introduisent Never Give Up (NGU), une méthode d'échantillonnage adaptatif qui génère des échantillons jusqu'à obtenir un résultat correct. En s'appuyant sur le RL asynchrone, NGU filtre les problèmes faciles avec moins de requêtes et réalloue la puissance de calcul vers les tâches complexes. Les tests sur des benchmarks de mathématiques et de code montrent que NGU améliore l'efficacité des calculs et résout des problèmes difficiles.

RL shows large improvements on easy problems that an LLM is already good at solving, but small improvements on hard problems.

mnoukhov · 11 sept. 2026 lire l'original ↗
↑