Consonance dimanche 20 septembre 2026 frenvi
01 · inference

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

QuestionComment réduire considérablement les coûts de calcul du pré-remplissage et l'empreinte massive du cache KV pour les agents à long horizon ?

L'article présente DeepSeek-V4.1-Flash, un modèle MoE multimodal doté de 552B paramètres de base et prenant en charge des contextes d'un million de tokens. Grâce à une architecture Causal Encoder-Decoder, il active 16B paramètres par token au décodage mais seulement 8B au pré-remplissage. En combinant la réutilisation du cache KV inter-couches dans Compressed Sparse Attention 2 et le cache KV en FP4, il réduit l'empreinte globale à 890 octets par token. De plus, l'optimisation SWA Bounded Replay réduit l'empreinte persistante à environ 1/8 de celle de DeepSeek-V4-Flash.

DeepSeek-V4.1-Flash est un modèle MoE multimodal avec 552B paramètres de base et une prise en charge de contextes allant jusqu'à un million de tokens.
Le modèle active 16B paramètres par token pendant le décodage mais seulement 8B paramètres pendant le pré-remplissage.
Ces conceptions réduisent l'empreinte globale du cache KV à 890 octets par token, soit environ 1/4 de celle de DeepSeek-V4-Flash.
↑ Haut de page