CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 7 votes

Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches

QUESTION — Comment le décodage parcimonieux sur des caches KV déchargés peut-il gérer des sessions d'agents d'un million de jetons sans engorger le trafic de décodage?

Les auteurs présentent Fathom, un balayage de clés où chaque requête décide dynamiquement du nombre de bits à lire pour chaque canal de cache K quantifié sur 4 bits stocké en plans de bits. En appliquant un remplissage d'eau inversé sur l'importance des canaux pondérée par la variance, la requête dépense son budget de bits. Sur Qwen3-8B à un million de jetons, une étape de décodage est 1.67x plus rapide en temps GPU que Double Sparsity, Loki et SparQ r=32, tout en lisant 18 % d'octets en moins avec une erreur d'attention plus faible.

À un million de jetons sur Qwen3-8B, une étape de décodage est 1.67x plus rapide en temps GPU que les balayages 136 bits de Double Sparsity, Loki et SparQ r=32.

Dans le même temps GPU que la lecture 68 bits de SparQ (r=16), Fathom lit 18 % d'octets en moins avec une erreur d'attention plus faible sur six configurations sur sept.

Sur les tâches de type RULER, chaque balayage par jeton correspond au décodage top-k exact, et sur les sessions de code, Fathom atteint l'accord de l'analyse 136 bits à 92 bits.

vivekkalyanarangan · 15 sept. 2026 lire l'original ↗
↑