Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
Ce travail résout les goulets d'étranglement des E/S mémoire et les limites du décodage parallèle dans les grands modèles de langage par diffusion (dLLMs) qui restreignent leur déploiement. Les auteurs présentent Flash-dLLM, un framework d'accélération d'inférence sans réentraînement doté d'un noyau de cache KV fusionné conscient des E/S et d'une stratégie unifiée de décodage brouillon-vérification pilotée par le cache KV. Cette conception élimine les mouvements de mémoire redondants et s'adapte efficacement. Des expériences sur des benchmarks de raisonnement mathématique et de code démontrent des accélérations significatives par rapport aux bases de référence existantes telles qu'Elastic-Cache.
Il atteint des accélérations de 5.1times par rapport à la base de référence précédente la plus puissante Elastic-Cache sur GSM8K.
Il atteint des accélérations de 11.0times par rapport à la base de référence précédente la plus puissante Elastic-Cache sur HumanEval.