The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction
Các tác giả giới thiệu Edge0, một streaming MoE inference engine khắc phục vấn đề nghẽn bộ nhớ khi offload mô hình 35B lên ổ cứng SSD bằng cách sử dụng một prerouter. Prerouter này dự đoán trước routing của layer tiếp theo một token trước, cho phép các lượt đọc từ SSD bắt đầu kịp thời mà không bị trễ. Bên cạnh đó, một recovery LoRA chưa hợp nhất được huấn luyện trên đường đi của học viên giúp bù đắp sự sụt giảm chất lượng do lượng tử hóa int4. Kết quả cho thấy trên một máy đơn 24GB, Edge0 phục vụ mô hình MoE 35B ở tốc độ 20tok/s với dung lượng bộ nhớ hoạt động đỉnh dưới 3GiB.
Edge0 sử dụng prerouter để dự đoán routing layer tiếp theo một token trước nhằm khắc phục vấn đề offload từ SSD.
Unmerged recovery LoRA giúp bù đắp chất lượng mất đi do int4 quantization và routing replacement.
Trên một máy đơn 24GB, Edge0 phục vụ mô hình MoE 35B ở tốc độ 20tok/s bên trong 3GiB peak active memory.