Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction
Les auteurs présentent Grouped Value Attention (GVA), une technique d'optimisation du cache KV qui stocke des valeurs groupées et reconstruit les clés de contenu à l'aide d'une application linéaire apprise. Lors de l'inférence, cette application peut être absorbée dans la requête, éliminant le besoin de matérialiser les clés de contenu, tandis qu'un petit canal RoPE partagé retient les informations positionnelles. À l'échelle de 350M paramètres avec 30B jetons FineWeb-Edu, la variante positionnelle à 16 dimensions atteint une précision moyenne de 44,18 sur cinq tâches, contre 44,36 pour GQA et 43,88 pour MLA, tout en réduisant les scalaires de cache persistants d'environ 45-47 %.
Grouped Value Attention (GVA) stocke des valeurs groupées et reconstruit les clés de contenu à l'aide d'une application linéaire apprise.
La variante positionnelle à 16 dimensions à l'échelle de 350M paramètres avec 30B jetons FineWeb-Edu atteint une précision moyenne de 44,18 sur cinq tâches.
GVA réduit les scalaires de cache persistants d'environ 45-47 % par rapport au GQA correspondant.