CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 9 votes

Disentangling Representation Evolution in Transformers through Directional Decomposition

QUESTION — Comment décomposer l'évolution des représentations dans les Transformers en composantes parallèles et perpendiculaires pour améliorer l'édition et la compression ?

Cette étude examine la géométrie fonctionnelle des représentations Transformer en décomposant les mises à jour apprises en composantes parallèles et perpendiculaires par rapport à l'état caché actuel. L'analyse des modèles pré-entraînés révèle des composantes parallèles substantielles au-delà du chemin d'identité résiduel. En appliquant cette décomposition aux mises à jour d'attention et de MLP, les auteurs découvrent une forte asymétrie spatiale dans la robustesse de l'édition : la manipulation parallèle dans l'espace des valeurs (exclude-self value-space) est nettement plus robuste. De plus, la suppression parallèle globale pendant le pré-entraînement à partir de zéro abaisse les trajectoires de perte de validation et améliore les performances en aval.

La manipulation parallèle dans l'espace des valeurs (exclude-self value-space) est nettement plus robuste que ses homologues dans l'espace résiduel et perpendiculaire.

La suppression parallèle globale pendant le pré-entraînement à partir de zéro abaisse les trajectoires de perte de validation et améliore les moyennes en aval.

shwai-he · 14 sept. 2026 lire l'original ↗
↑