CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 22 votes

Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning

QUESTION — Comment attribuer efficacement du crédit au niveau des jetons en apprentissage par renforcement sans recourir à des modèles auxiliaires ?

Ce travail présente l'Entropic Advantage Policy Optimization (EAPO), une méthode d'attribution de crédit guidée par l'entropie qui traite asymétriquement les succès et les échecs pour améliorer le raisonnement des grands modèles de langage. En combinant l'entropie de politique normalisée et le signe de l'avantage de réponse, EAPO renforce les succès surprenants tout en pénalisant les échecs confiants, sans supprimer les opportunités de récupération. Dérivée directement des signaux de déploiement existants, elle favorise une exploration plus efficace et améliore la performance globale du raisonnement.

EAPO traite le succès et l'échec de manière asymétrique en couplant l'entropie de politique normalisée au signe de l'avantage de réponse.

La méthode déduit le crédit au niveau des jetons directement à partir des signaux existants sans supervision supplémentaire.

EAPO atteint la meilleure performance globale sur une série de tâches de raisonnement.

wgcyeo · 27 sept. 2026 lire l'original ↗
↑