CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — inference 6 upvote

SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops

CÂU HỎI — Các engine phục vụ LLM trên máy tính để bàn có bộ nhớ thống nhất hoạt động như thế nào qua các tiêu chí tốc độ, bộ nhớ và độ trung thực?

Nghiên cứu giới thiệu SiliconBench để đánh giá 9 Apple Silicon serving engine thông qua ba khía cạnh: tốc độ, bộ nhớ và độ trung thực bằng cách sử dụng các tác vụ trò chuyện và agent trên các mô hình như Qwen3, Qwen3.5 và Gemma 4. Kết quả cho thấy các hạn mức bộ nhớ rõ ràng không đảm bảo dư lượng bộ nhớ và việc lên lịch xử lý prompt song song với quá trình sinh token là rất quan trọng để duy trì độ trễ token đầu tiên thấp. Hơn nữa, nghiên cứu chứng minh rằng tính song song tensor qua Thunderbolt RDMA có thể mở rộng quy mô trong khi tính song song đường ống qua TCP bị suy giảm.

vllm-metal đơn độc tăng gấp đôi thông lượng trên cả hai khối lượng công việc từ độ đồng thời 1 đến 16 trên Qwen3-0.6B.

Chỉ có ba stack thỏa mãn các cổng hoàn thành, độ trung thực và độ bao phủ mô hình.

Tính song song tensor qua Thunderbolt RDMA có thể mở rộng quy mô trong khi tính song song đường ống qua TCP bị suy giảm.

windchimeran · 12 thg 9, 2026 đọc bản gốc ↗
↑