CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — inference 18 votes

The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction

QUESTION — Comment servir de grands modèles Mixture-of-Experts depuis un SSD sur du matériel grand public sans heurter le goulot d'étranglement de la mémoire de poids ?

Les auteurs présentent Edge0, un moteur d'inférence MoE en streaming qui résout les goulot d'étranglement de la mémoire lors du déchargement d'un modèle 35B sur un SSD en utilisant un pré-routeur. Ce pré-routeur prédit le routage de la couche suivante un jeton à l'avance, permettant aux lectures sur SSD de démarrer assez tôt pour se masquer derrière le calcul. De plus, un LoRA de récupération non fusionné entraîné sur le chemin de l'étudiant compense la perte de qualité due à la quantification int4. Les résultats montrent que sur une seule machine de 24 Go, Edge0 sert un MoE 35B à 20 tok/s dans une mémoire active de pointe de 3 Go.

Edge0 utilise un pré-routeur pour prédire le routage de la couche suivante un jeton à l'avance afin de surmonter la latence de déchargement sur SSD.

Un LoRA de récupération non fusionné compense la qualité perdue lors de la quantification int4 et du remplacement de routage.

Sur une seule machine de 24 Go, Edge0 sert un MoE 35B à 20 tok/s dans une mémoire active de pointe de 3 Go.

bupalinyu · 16 sept. 2026 lire l'original ↗
↑