Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models
Ce travail étudie la manière dont les grands modèles de langage gèrent les conflits de valeurs morales à l'aide d'un ensemble de données de 12 000 cas couvrant des dilemmes à deux options. Pour dissocier l'apprentissage des corrélations des valeurs abstraites, les auteurs proposent une expérience de transfert de vecteur de tâche. En orthogonalisant le vecteur de tâche par rapport au vecteur de suivi des instructions générales, la méthode isole avec succès la direction des préférences de valeurs spécifiques, permettant d'effectuer une arithmétique des tâches pour obtenir un modèle ayant la position opposée.
GPT-5-mini privilégie systématiquement l'honnêteté à l'autonomie dans les cinq langues lorsqu'aucune politique n'est fournie.
Le réglage fin classique et l'optimisation des préférences directes éliminent efficacement le biais de la première option, augmentant la précision à plus de 98 % sur les modèles Llama-3.2-1/3B.
Le transfert de vecteur de tâche basé sur l'orthogonalisation isole efficacement la direction de la préférence de valeur spécifique pour l'arithmétique des tâches.