CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 12 votes

WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms

QUESTION — Comment optimiser la quantification du cache KV à faible nombre de bits à l'aide de transformations adaptées aux données pour minimiser l'erreur de reconstruction ?

Les coûts de mémoire et de bande passante du cache KV limitent l'inférence à long contexte. Les auteurs présentent WUSH-KV pour la quantification du cache KV à faible nombre de bits, adaptant WUSH pour construire une transformation consciente des données à partir de statistiques du second ordre. WUSH-KV utilise des données d'étalonnage pour construire des transformations de clés et de valeurs distinctes, intégrant la transformation de valeur dans les poids du modèle et appliquant celle de clé après RoPE. Intégré dans SGLang à l'aide d'une quantification affine rognée de style OSCAR, WUSH-KV réduit l'erreur de reconstruction par couche. À 2 bits, WUSH-KV offre des performances comparables ou supérieures à la transformation OSCAR sur tous les modèles évalués.

WUSH-KV utilise des données d'étalonnage pour construire des transformations de clés et de valeurs distinctes.

La transformation de valeur est intégrée dans les poids et celle de clé est appliquée après RoPE.

À 2 bits, WUSH-KV offre des performances comparables ou supérieures à la transformation OSCAR sur tous les modèles évalués.

softmax · 29 sept. 2026 lire l'original ↗
↑