MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
Cet article présente Mixture of Memory Embeddings (MoME), un mécanisme de mémoire contextuelle conditionnelle qui remplace une table de plongement de tokens statique par un mélange de M emplacements. En utilisant une porte apprise sur les états cachés pour acheminer chaque position, MoME résout les tokens polysémiques dans des emplacements de mémoire distincts selon le contexte. Des expériences de pré-entraînement contrôlées sur plusieurs architectures de base démontrent que MoME surpasse les bases de référence Value Embedding, Bigram et STEM dans des conditions d'isoparamètres et d'isoflops d'entraînement.
Il s'améliore par rapport aux bases de référence Value Embedding, Bigram et STEM dans des paramètres iso et des réglages iso-training-FLOP.
Il montre une tendance de mise à l'échelle de la taille de la mémoire plus prometteuse à l'échelle sous-milliard.