Learning to Solve Hard Problems in RL for LLMs by Never Giving Up
Cet article met en évidence l'effet Matthieu dans l'apprentissage par renforcement (RL) pour les LLM, où le RL privilégie nettement les problèmes faciles au détriment des problèmes difficiles. Pour résoudre ce problème, les auteurs introduisent Never Give Up (NGU), une méthode d'échantillonnage adaptatif qui génère des échantillons jusqu'à obtenir un résultat correct. En s'appuyant sur le RL asynchrone, NGU filtre les problèmes faciles avec moins de requêtes et réalloue la puissance de calcul vers les tâches complexes. Les tests sur des benchmarks de mathématiques et de code montrent que NGU améliore l'efficacité des calculs et résout des problèmes difficiles.
RL shows large improvements on easy problems that an LLM is already good at solving, but small improvements on hard problems.