CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 67 votes

Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs

QUESTION — Comment transférer le cache KV entre des familles de modèles hétérogènes dans des systèmes multi-agents sans nécessiter de pré-remplissage par le récepteur?

Les auteurs proposent HeteroFold, une méthode de transfert de cache KV inter-familles sans pré-remplissage qui maintient figés les modèles émetteur et récepteur. En alignant les structures des modèles, en mappant le cache de l'émetteur dans l'espace du récepteur et en le calibrant, HeteroFold permet une réutilisation efficace du cache KV sans pré-remplissage. La méthode obtient les meilleures performances sur quatre benchmarks à long contexte et atteint, pour une longueur de contexte de 32K, une vitesse 10,7 fois supérieure à celle du pré-remplissage natif et 1,18 à 1,47 fois supérieure aux références existantes.

HeteroFold atteint les meilleures performances de transfert de cache sur les quatre benchmarks à long contexte et la plupart des contextes courts.

À une longueur de contexte de 32K, le transfert Llama-3.1-8BrightarrowMinistral-3-14B est 10,7times plus rapide que le pré-remplissage natif.

Il est 1,18--1,47times plus rapide que les références de pointe sans pré-remplissage, Dense Latent et KV Ridge.

yunuyean · 29 sept. 2026 lire l'original ↗
↑