CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — inference 36 upvote

Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs

CÂU HỎI — Làm thế nào để tăng tốc Diffusion Large Language Models và tiết kiệm bộ nhớ GPU trong quá trình suy luận?

Nghiên cứu này giải quyết các điểm nghẽn về I/O bộ nhớ và tính toán phân tán trong Diffusion Large Language Models (dLLMs) vốn làm hạn chế khả năng triển khai thực tế. Tác giả giới thiệu Flash-dLLM, một framework tăng tốc suy luận không cần huấn luyện, gồm kernel KV-cache gộp nhận thức I/O và chiến lược giải mã dự đoán-xác thực điều khiển bằng KV-cache riêng của mô hình. Phương pháp này giảm thiểu chuyển động bộ nhớ dư thừa và cho phép dLLM tự làm cả việc soạn thảo lẫn xác thực. Kết quả thực nghiệm trên các benchmark mã nguồn và toán học cho thấy tốc độ vượt trội so với baseline Elastic-Cache.

Đạt tốc độ nhanh hơn 5.1times so với baseline mạnh nhất trước đó là Elastic-Cache trên GSM8K.

Đạt tốc độ nhanh hơn 11.0times so với baseline mạnh nhất trước đó là Elastic-Cache trên HumanEval.

mukul54 · 22 thg 9, 2026 đọc bản gốc ↗
↑