CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 9 upvote

Disentangling Representation Evolution in Transformers through Directional Decomposition

CÂU HỎI — Làm thế nào để phân rã sự tiến hóa biểu diễn trong các mô hình Transformer thành các thành phần song song và vuông góc nhằm cải thiện khả năng chỉnh sửa và nén?

Nghiên cứu này khảo sát hình học chức năng của các biểu diễn trong mạng Transformer bằng cách phân rã các cập nhật học được thành các thành phần song song và vuông góc so với trạng thái ẩn hiện tại. Phân tích trên các mô hình tiền huấn luyện cho thấy các thành phần song song lớn tồn tại bên ngoài đường dẫn danh tính phần dư (residual identity path). Áp dụng phép phân rã này vào các cập nhật chú ý (attention) và MLP, các tác giả phát hiện ra sự bất đối xứng rõ rệt về không gian chỉnh sửa: việc thao tác không gian giá trị loại trừ chính nó (exclude-self value-space) có khả năng chống chịu tốt hơn nhiều. Hơn nữa, việc triệt tiêu thành phần song song trong toàn bộ tập hợp trong quá trình huấn luyện từ đầu giúp hạ thấp đường cong mất mát xác thực và cải thiện hiệu suất chung.

Phép thao tác không gian giá trị loại trừ chính nó (exclude-self value-space parallel manipulation) tỏ ra vượt trội và mạnh mẽ hơn đáng kể so với các biến thể không gian phần dư và vuông góc.

Việc triệt tiêu thành phần song song toàn tập hợp trong quá trình tiền huấn luyện từ đầu giúp hạ thấp quỹ đạo mất mát xác thực (validation-loss trajectories) và nâng cao hiệu quả trung bình ở các tác vụ hạ nguồn.

shwai-he · 14 thg 9, 2026 đọc bản gốc ↗
↑