Persona Dosing: Calibrated Activation Steering for Graded Trait Control
Ce travail présente PersonaDose, une méthode pour contrôler les modèles de langage à l'aide d'une description de trait et d'une intensité moyenne demandée. En spécialisant un contrôleur FLAS partagé sur des réponses de personnages et en calibrant son temps de flux par rapport à l'expression mesurée du trait sans cibles d'entraînement appariées, l'approche augmente l'expression des traits fondamentaux par rapport à l'addition d'activation contrastive. Évalué sur Llama-3.1-8B, Qwen3-8B et Gemma-3-4B, les réglages sélectionnés par calibration conservent un avantage d'expression sur les questions de test et atteignent de faibles erreurs de ciblage moyennes sur les cibles atteignables par calibration.
PersonaDose raises core-trait expression at the Persona Vectors coherence floor of 75 by 33.2, 18.3, and 17.8 points over contrastive activation addition.
Across seven trained traits, calibrated requests yield mean targeting errors of 4.7-6.2 points over 14-22 calibration-reachable targets out of 28 per model.