Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction
Nhóm tác giả giới thiệu Grouped Value Attention (GVA), một kỹ thuật tối ưu hóa KV cache giúp lưu trữ các giá trị được gom nhóm (grouped values) và tái tạo khóa nội dung thông qua một phép ánh xạ tuyến tính đã học. Phép ánh xạ này có thể được hấp thụ trực tiếp vào query khi suy luận, loại bỏ nhu cầu lưu trữ khóa nội dung trong đường dẫn giải mã dự định, trong khi một kênh RoPE chia sẻ nhỏ giữ lại thông tin vị trí. Ở quy mô 350M tham số với 30B token FineWeb-Edu, biến thể vị trí 16 chiều đạt độ chính xác trung bình 44,18 trên năm tác vụ, so với 44,36 của GQA và 43,88 của MLA, đồng thời giảm khoảng 45-47% số lượng scalar cache so với GQA tương ứng.
Grouped Value Attention (GVA) lưu trữ giá trị gom nhóm và tái tạo khóa nội dung bằng một phép ánh xạ tuyến tính đã học.
Biến thể vị trí 16 chiều ở quy mô 350M tham số với 30B token FineWeb-Edu đạt độ chính xác trung bình 44,18 trên năm tác vụ.
GVA giảm khoảng 45-47% số scalar cache bền vững so với GQA tương ứng.