WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms
Les coûts de mémoire et de bande passante du cache KV limitent l'inférence à long contexte. Les auteurs présentent WUSH-KV pour la quantification du cache KV à faible nombre de bits, adaptant WUSH pour construire une transformation consciente des données à partir de statistiques du second ordre. WUSH-KV utilise des données d'étalonnage pour construire des transformations de clés et de valeurs distinctes, intégrant la transformation de valeur dans les poids du modèle et appliquant celle de clé après RoPE. Intégré dans SGLang à l'aide d'une quantification affine rognée de style OSCAR, WUSH-KV réduit l'erreur de reconstruction par couche. À 2 bits, WUSH-KV offre des performances comparables ou supérieures à la transformation OSCAR sur tous les modèles évalués.
WUSH-KV utilise des données d'étalonnage pour construire des transformations de clés et de valeurs distinctes.
La transformation de valeur est intégrée dans les poids et celle de clé est appliquée après RoPE.
À 2 bits, WUSH-KV offre des performances comparables ou supérieures à la transformation OSCAR sur tous les modèles évalués.