SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops
Nghiên cứu giới thiệu SiliconBench để đánh giá 9 Apple Silicon serving engine thông qua ba khía cạnh: tốc độ, bộ nhớ và độ trung thực bằng cách sử dụng các tác vụ trò chuyện và agent trên các mô hình như Qwen3, Qwen3.5 và Gemma 4. Kết quả cho thấy các hạn mức bộ nhớ rõ ràng không đảm bảo dư lượng bộ nhớ và việc lên lịch xử lý prompt song song với quá trình sinh token là rất quan trọng để duy trì độ trễ token đầu tiên thấp. Hơn nữa, nghiên cứu chứng minh rằng tính song song tensor qua Thunderbolt RDMA có thể mở rộng quy mô trong khi tính song song đường ống qua TCP bị suy giảm.
vllm-metal đơn độc tăng gấp đôi thông lượng trên cả hai khối lượng công việc từ độ đồng thời 1 đến 16 trên Qwen3-0.6B.
Chỉ có ba stack thỏa mãn các cổng hoàn thành, độ trung thực và độ bao phủ mô hình.
Tính song song tensor qua Thunderbolt RDMA có thể mở rộng quy mô trong khi tính song song đường ống qua TCP bị suy giảm.