CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 12 upvote

MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup

CÂU HỎI — Làm thế nào để mô hình ngôn ngữ lớn xử lý các ngữ nghĩa đa dạng của cùng một token mà không làm tăng chi phí tính toán?

Nghiên cứu này giới thiệu Mixture of Memory Embeddings (MoME), một cơ chế bộ nhớ ngữ cảnh có điều kiện nhằm thay thế bảng embedding token tĩnh bằng một hỗn hợp gồm M khe cắm. Bằng cách sử dụng một cổng học được trên trạng thái ẩn để định tuyến tại mỗi vị trí, MoME phân giải các từ đồng âm hoặc đa nghĩa vào các ô nhớ riêng biệt tùy theo ngữ cảnh. Các thử nghiệm tiền huấn luyện có kiểm soát trên nhiều kiến trúc backbone cho thấy MoME vượt trội hơn các baseline như Value Embedding, Bigram và STEM trong các thiết lập cùng số lượng tham số và cùng lượng tính toán FLOPs.

Cải thiện vượt trội so với các baseline Value Embedding, Bigram và STEM trong các thiết lập iso-parameter và iso-training-FLOP.

Thể hiện xu hướng mở rộng kích thước bộ nhớ đầy hứa hẹn ở quy mô dưới một tỷ tham số.

jojo23333 · 14 thg 9, 2026 đọc bản gốc ↗
↑