CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — inference 12 upvote

WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms

CÂU HỎI — Làm thế nào để tối ưu hóa lượng tử hóa KV cache low-bit bằng cách sử dụng các biến đổi thích ứng theo dữ liệu để giảm thiểu sai số tái tạo?

Chi phí bộ nhớ và băng thông của KV cache giới hạn hiệu suất suy luận ngữ cảnh dài. Tác giả giới thiệu WUSH-KV, một phương pháp lượng tử hóa KV cache low-bit áp dụng các phép biến đổi thích ứng dựa trên dữ liệu từ thống kê bậc hai của các nhân tử tích ma trận. WUSH-KV sử dụng dữ liệu hiệu chuẩn để xây dựng các biến đổi key và value riêng biệt, trong đó biến đổi value được gấp vào trọng số mô hình và biến đổi key áp dụng sau RoPE. Tích hợp vào SGLang bằng phương pháp lượng tử hóa affine cắt tỉa phân vị kiểu OSCAR, WUSH-KV đạt hiệu suất tương đương hoặc vượt trội so với phép biến đổi OSCAR ở mức 2-bit trên các mô hình và tác vụ đánh giá.

WUSH-KV sử dụng calibration data để xây dựng separate key and value transforms.

Value transform được folded into the model weights và key transform được applied sau RoPE.

Tại 2-bit, WUSH-KV performs comparably to or outperforms the OSCAR transform across all evaluated models.

softmax · 29 thg 9, 2026 đọc bản gốc ↗
↑