MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
Nghiên cứu này giới thiệu Mixture of Memory Embeddings (MoME), một cơ chế bộ nhớ ngữ cảnh có điều kiện nhằm thay thế bảng embedding token tĩnh bằng một hỗn hợp gồm M khe cắm. Bằng cách sử dụng một cổng học được trên trạng thái ẩn để định tuyến tại mỗi vị trí, MoME phân giải các từ đồng âm hoặc đa nghĩa vào các ô nhớ riêng biệt tùy theo ngữ cảnh. Các thử nghiệm tiền huấn luyện có kiểm soát trên nhiều kiến trúc backbone cho thấy MoME vượt trội hơn các baseline như Value Embedding, Bigram và STEM trong các thiết lập cùng số lượng tham số và cùng lượng tính toán FLOPs.
Cải thiện vượt trội so với các baseline Value Embedding, Bigram và STEM trong các thiết lập iso-parameter và iso-training-FLOP.
Thể hiện xu hướng mở rộng kích thước bộ nhớ đầy hứa hẹn ở quy mô dưới một tỷ tham số.