Consonance Chủ Nhật, 20 tháng 9, 2026 frenvi
01 · inference

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

Câu hỏiLàm thế nào để giảm thiểu chi phí tính toán prefill và dung lượng KV cache lớn vốn là nút thắt cổ chai trong các tác vụ agentic dài hạn?

Bài báo giới thiệu DeepSeek-V4.1-Flash, một mô hình Mixture-of-Experts đa phương thức với 552B tham số nền tảng hỗ trợ ngữ cảnh một triệu token. Kiến trúc Causal Encoder-Decoder của mô hình chỉ kích hoạt 8B tham số trong giai đoạn prefill và 16B trong giai đoạn decode. Để nén KV cache, mô hình kết hợp cơ chế tái sử dụng KV cache đa tầng trong Compressed Sparse Attention 2 cùng định dạng FP4 KV caching, qua đó giảm dung lượng xuống còn 890 byte mỗi token. Thêm vào đó, tối ưu hóa SWA Bounded Replay hạ dung lượng KV cache lưu trữ bền vững xuống khoảng 1/8 so với phiên bản DeepSeek-V4-Flash trên kho dữ liệu 45T token.

Mô hình sở hữu 552B tham số nền tảng (backbone parameters) và hỗ trợ ngữ cảnh lên tới một triệu token.
Kích hoạt 16B tham số mỗi token trong giai đoạn decode nhưng chỉ 8B tham số trong giai đoạn prefill.
Giảm dung lượng KV cache toàn cục xuống còn 890 byte mỗi token, tương đương khoảng 1/4 so với DeepSeek-V4-Flash.
↑ Lên đầu trang