Parts-of-Speech as Emergent Categories in SAE Latent Space
Cette étude examine comment les Sparse AutoEncoders (SAEs) capturent la structure linguistique en utilisant les catégories de parties du discours (PoS) comme cas de test contrôlé. Les auteurs constatent que les distinctions PoS sont hautement récupérables à partir des activations des SAE, sans pour autant correspondre à des mappages biunivoques. L'information morpho-syntaxique est ainsi localisée sous une forme distribuée et dépendante de la catégorie, portée par des groupes compacts de latents plutôt que par des traits grammaticaux atomiques.
PoS distinctions are highly recoverable from SAE activations, but do not align with one-to-one latent / category mappings.
Categories are supported by compact groups of sparse latents, with substantial variation across tags.
These groups remain stable on held-out data, while also showing overlap between related categories.