CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 48 votes

Persona Dosing: Calibrated Activation Steering for Graded Trait Control

QUESTION — Comment contrôler avec précision l'intensité d'expression d'un personnage dans un grand modèle de langage selon une intensité moyenne demandée?

Ce travail présente PersonaDose, une méthode pour contrôler les modèles de langage à l'aide d'une description de trait et d'une intensité moyenne demandée. En spécialisant un contrôleur FLAS partagé sur des réponses de personnages et en calibrant son temps de flux par rapport à l'expression mesurée du trait sans cibles d'entraînement appariées, l'approche augmente l'expression des traits fondamentaux par rapport à l'addition d'activation contrastive. Évalué sur Llama-3.1-8B, Qwen3-8B et Gemma-3-4B, les réglages sélectionnés par calibration conservent un avantage d'expression sur les questions de test et atteignent de faibles erreurs de ciblage moyennes sur les cibles atteignables par calibration.

PersonaDose raises core-trait expression at the Persona Vectors coherence floor of 75 by 33.2, 18.3, and 17.8 points over contrastive activation addition.

Across seven trained traits, calibrated requests yield mean targeting errors of 4.7-6.2 points over 14-22 calibration-reachable targets out of 28 per model.

Lunamos · 28 sept. 2026 lire l'original ↗
↑