CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 10 votes

Parts-of-Speech as Emergent Categories in SAE Latent Space

QUESTION — Comment les Sparse AutoEncoders représentent-ils l'information morpho-syntaxique dans l'espace latent des modèles de langage ?

Cette étude examine comment les Sparse AutoEncoders (SAEs) capturent la structure linguistique en utilisant les catégories de parties du discours (PoS) comme cas de test contrôlé. Les auteurs constatent que les distinctions PoS sont hautement récupérables à partir des activations des SAE, sans pour autant correspondre à des mappages biunivoques. L'information morpho-syntaxique est ainsi localisée sous une forme distribuée et dépendante de la catégorie, portée par des groupes compacts de latents plutôt que par des traits grammaticaux atomiques.

PoS distinctions are highly recoverable from SAE activations, but do not align with one-to-one latent / category mappings.

Categories are supported by compact groups of sparse latents, with substantial variation across tags.

These groups remain stable on held-out data, while also showing overlap between related categories.

alessandrobondielli · 24 sept. 2026 lire l'original ↗
↑