Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
Ce travail présente l'Entropic Advantage Policy Optimization (EAPO), une méthode d'attribution de crédit guidée par l'entropie qui traite asymétriquement les succès et les échecs pour améliorer le raisonnement des grands modèles de langage. En combinant l'entropie de politique normalisée et le signe de l'avantage de réponse, EAPO renforce les succès surprenants tout en pénalisant les échecs confiants, sans supprimer les opportunités de récupération. Dérivée directement des signaux de déploiement existants, elle favorise une exploration plus efficace et améliore la performance globale du raisonnement.
EAPO traite le succès et l'échec de manière asymétrique en couplant l'entropie de politique normalisée au signe de l'avantage de réponse.
La méthode déduit le crédit au niveau des jetons directement à partir des signaux existants sans supervision supplémentaire.
EAPO atteint la meilleure performance globale sur une série de tâches de raisonnement.