CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 77 votes

Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs

QUESTION — Comment les grands modèles de langage manifestent-ils une linéarité de superposition lorsque des flux de texte distincts sont combinés linéairement ?

Ce travail démontre que les grands modèles de langage présentent une linéarité fondamentale : lorsque des entrées de flux textuels distincts sont combinées linéairement, le modèle produit une superposition des distributions individuelles de tokens suivants. Cette propriété tend à diminuer pendant le pré-entraînement mais peut être restaurée par un fine-tuning léger. De plus, les auteurs introduisent une procédure de décodage guidé qui désenchevêtre les sorties superposées.

Les LLM présentent une linéarité de superposition lorsque les flux d'entrée sont combinés linéairement.

La linéarité peut être restaurée de manière substantielle grâce à un fine-tuning léger.

Une procédure de décodage guidé permet la génération simultanée de deux continuations cohérentes à partir d'une seule passe avant.

razzant · 24 sept. 2026 lire l'original ↗
↑