Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
Bài báo đề xuất Fathom, một cơ chế quét key trong đó mỗi query tự quyết định đọc bao nhiêu bit từ mỗi channel của KV cache lượng tử hóa 4-bit được lưu trữ theo dạng bit planes. Bằng cách sử dụng phương pháp reverse water-filling dựa trên tầm quan trọng trọng số phương sai của các channel, query phân bổ ngân sách bit của mình một cách linh hoạt. Kết quả thực nghiệm trên Qwen3-8B với bối cảnh một triệu token cho thấy bước giải mã nhanh hơn 1.67x thời gian GPU so với các kỹ thuật như Double Sparsity, Loki và SparQ r=32. Fathom đọc ít hơn 18% byte với sai số attention thấp hơn ở hầu hết các cài đặt mô hình mà vẫn khớp hoàn toàn với top-k decoding chuẩn.
Ở quy mô một triệu token trên Qwen3-8B, bước giải mã nhanh hơn 1.67x thời gian GPU so với các quét 136-bit của Double Sparsity, Loki và SparQ r=32.
Ở cùng thời gian GPU với mức đọc 68-bit của SparQ (r=16), Fathom đọc ít hơn 18% byte với sai số attention thấp hơn ở 6 trên 7 cấu hình.
Trên các tác vụ kiểu RULER, mọi per-token scan đều khớp chính xác với top-k decoding, và đạt độ đồng thuận bước chạy của quét 136-bit tại 92 bits trên các phiên coding-agent.