The Router Within: Eliciting Native Skill Routing from a Frozen LLM
Cet article présente Gavel, une architecture qui extrait les signaux de routage des compétences directement à partir des états des couches intermédiaires d'un LLM gelé, sans nécessiter de texte de compétence dans le contexte. Gavel fonctionne en deux étapes : une phase de coup d'œil (glance) qui note l'ensemble de la bibliothèque de compétences par rapport à des banques compactes, et une phase de verdict qui confirme la sélection en utilisant les propres probabilités du modèle. Les expériences montrent que cette approche légère surpasse les pipelines lourds de récupération et de ré-classement.
Gavel surpasse les pipelines de divulgation progressive et de récupération-ré-classement qui ajoutent de 1,2B à 16B paramètres externes.
Il améliore les performances jusqu'à 13,4 points sur les tâches textuelles.
Il améliore les performances jusqu'à 21,9 points lorsque le besoin d'une compétence survient en cours d'exécution.