Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
Les auteurs présentent Fathom, un balayage de clés où chaque requête décide dynamiquement du nombre de bits à lire pour chaque canal de cache K quantifié sur 4 bits stocké en plans de bits. En appliquant un remplissage d'eau inversé sur l'importance des canaux pondérée par la variance, la requête dépense son budget de bits. Sur Qwen3-8B à un million de jetons, une étape de décodage est 1.67x plus rapide en temps GPU que Double Sparsity, Loki et SparQ r=32, tout en lisant 18 % d'octets en moins avec une erreur d'attention plus faible.
À un million de jetons sur Qwen3-8B, une étape de décodage est 1.67x plus rapide en temps GPU que les balayages 136 bits de Double Sparsity, Loki et SparQ r=32.
Dans le même temps GPU que la lecture 68 bits de SparQ (r=16), Fathom lit 18 % d'octets en moins avec une erreur d'attention plus faible sur six configurations sur sept.
Sur les tâches de type RULER, chaque balayage par jeton correspond au décodage top-k exact, et sur les sessions de code, Fathom atteint l'accord de l'analyse 136 bits à 92 bits.