CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 10 upvote

Parts-of-Speech as Emergent Categories in SAE Latent Space

CÂU HỎI — Sparse AutoEncoders biểu diễn thông tin hình thái-cú pháp trong latent space của LLM như thế nào?

Nghiên cứu này khảo sát cách Sparse AutoEncoders (SAEs) nắm bắt thông tin cấu trúc ngôn ngữ bằng cách sử dụng các danh mục Part-of-Speech (PoS) làm trường hợp kiểm thử. Các tác giả phát hiện ra rằng các đặc trưng PoS có thể khôi phục cao từ các activation của SAE nhưng không khớp với ánh xạ một đối một giữa latent và danh mục. Thông tin này được mã hóa thông qua các nhóm latent thưa thớt gọn nhẹ, mang tính phân tán và phụ thuộc vào từng danh mục thay vì các tính năng ngữ pháp nguyên tử riêng lẻ.

PoS distinctions are highly recoverable from SAE activations, but do not align with one-to-one latent / category mappings.

Categories are supported by compact groups of sparse latents, with substantial variation across tags.

These groups remain stable on held-out data, while also showing overlap between related categories.

alessandrobondielli · 24 thg 9, 2026 đọc bản gốc ↗
↑