CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 54 votes

Disaggregated Quantization: Specializing LLM Prefill and Decode

QUESTION — Comment spécialiser les formats de quantification pour les phases de préremplissage et de décodage des LLM afin d'améliorer l'efficacité de l'inférence ?

L'article propose la « quantification désagrégée » (DQ) pour spécialiser les formats de calcul, les poids et le stockage pour les phases de préremplissage et de décodage des LLM. En supprimant la quantification des activations lors du décodage et en entraînant des poids de préremplissage natifs, l'approche accélère le traitement des invites tout en préservant la précision. Le système ODP diffuse les poids depuis un SSD, offrant des accélérations substantielles dans llama.cpp et vLLM.

With released Qwen3.8-27B GGUF decoders, training an NVFP4 prefiller improves 1-bit accuracy by 32.5 points on MMLU-Pro and 35.3 on MMMU-Pro without modifying the decode checkpoint.

On the same 27B model, ODP delivers a 1.78x time-to-first-token speedup over the weight-only baseline at 8K prompt length in llama.cpp.

We evaluate accuracy under disaggregated serving in vLLM and further validate shared-weight format disaggregation through post-training quantization on models up to 2.8T parameters.

BlackSamorez · 22 sept. 2026 lire l'original ↗
↑