Disentangling Representation Evolution in Transformers through Directional Decomposition
Cette étude examine la géométrie fonctionnelle des représentations Transformer en décomposant les mises à jour apprises en composantes parallèles et perpendiculaires par rapport à l'état caché actuel. L'analyse des modèles pré-entraînés révèle des composantes parallèles substantielles au-delà du chemin d'identité résiduel. En appliquant cette décomposition aux mises à jour d'attention et de MLP, les auteurs découvrent une forte asymétrie spatiale dans la robustesse de l'édition : la manipulation parallèle dans l'espace des valeurs (exclude-self value-space) est nettement plus robuste. De plus, la suppression parallèle globale pendant le pré-entraînement à partir de zéro abaisse les trajectoires de perte de validation et améliore les performances en aval.
La manipulation parallèle dans l'espace des valeurs (exclude-self value-space) est nettement plus robuste que ses homologues dans l'espace résiduel et perpendiculaire.
La suppression parallèle globale pendant le pré-entraînement à partir de zéro abaisse les trajectoires de perte de validation et améliore les moyennes en aval.