CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 8 votes

SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

QUESTION — Comment éliminer la mauvaise attribution de crédit inter-segment lors de l'apprentissage par renforcement pour les LLM appelant des outils ?

Les auteurs proposent SLCA-GRPO, un cadre résolvant la mauvaise attribution de crédit inter-segment causée par la diffusion d'avantages homogènes à tous les tokens dans le RL standard. Le cadre intègre l'attribution de crédit verrouillée par segment (SLCA), une infrastructure de simulateur LLM guidée par schéma (SGLS) et des récompenses hiérarchiques (HierR). En découplant l'estimation des avantages au niveau du segment structurel, SLCA achemine les avantages d'exécution vers les tokens d'outils et les avantages de préférence vers les tokens de résumé. Sur une base de 7B, SLCA-GRPO accélère la convergence et surpasse les méthodes de référence.

Sur un modèle de base de 7B, SLCA-GRPO accélère la convergence et surpasse GRPO, ToolPO et RLTR de +2,53 pp sur l'évaluation dans le domaine.

Il obtient +1.36 pp sur le Berkeley Function-Calling Leaderboard (BFCL).

Il obtient +9.15 pp sur τ^2-Bench sous les mêmes budgets d'entraînement.

YanZhanPKU · 24 sept. 2026 lire l'original ↗
↑