Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Ce travail démontre que les grands modèles de langage présentent une linéarité fondamentale : lorsque des entrées de flux textuels distincts sont combinées linéairement, le modèle produit une superposition des distributions individuelles de tokens suivants. Cette propriété tend à diminuer pendant le pré-entraînement mais peut être restaurée par un fine-tuning léger. De plus, les auteurs introduisent une procédure de décodage guidé qui désenchevêtre les sorties superposées.
Les LLM présentent une linéarité de superposition lorsque les flux d'entrée sont combinés linéairement.
La linéarité peut être restaurée de manière substantielle grâce à un fine-tuning léger.
Une procédure de décodage guidé permet la génération simultanée de deux continuations cohérentes à partir d'une seule passe avant.