CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 76 votes

Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction

QUESTION — Comment réduire l'empreinte mémoire et le trafic de lecture du cache KV lors du décodage des Transformers sans sacrifier la précision ?

Les auteurs présentent Grouped Value Attention (GVA), une technique d'optimisation du cache KV qui stocke des valeurs groupées et reconstruit les clés de contenu à l'aide d'une application linéaire apprise. Lors de l'inférence, cette application peut être absorbée dans la requête, éliminant le besoin de matérialiser les clés de contenu, tandis qu'un petit canal RoPE partagé retient les informations positionnelles. À l'échelle de 350M paramètres avec 30B jetons FineWeb-Edu, la variante positionnelle à 16 dimensions atteint une précision moyenne de 44,18 sur cinq tâches, contre 44,36 pour GQA et 43,88 pour MLA, tout en réduisant les scalaires de cache persistants d'environ 45-47 %.

Grouped Value Attention (GVA) stocke des valeurs groupées et reconstruit les clés de contenu à l'aide d'une application linéaire apprise.

La variante positionnelle à 16 dimensions à l'échelle de 350M paramètres avec 30B jetons FineWeb-Edu atteint une précision moyenne de 44,18 sur cinq tâches.

GVA réduit les scalaires de cache persistants d'environ 45-47 % par rapport au GQA correspondant.

vishesh-t27 · 08 sept. 2026 lire l'original ↗
↑