SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops
L'étude présente SiliconBench pour évaluer neuf moteurs de service Apple Silicon à travers la vitesse, la mémoire et la fidélité en utilisant des charges de travail de chat et d'agent sur des modèles tels que Qwen3, Qwen3.5 et Gemma 4. Les résultats révèlent que les budgets mémoire explicites ne garantissent pas de marge de manœuvre et que la planification du traitement des requêtes aux côtés de la génération continue est essentielle pour maintenir une faible latence du premier jeton. De plus, le parallélisme des tenseurs sur Thunderbolt RDMA passe à l'échelle tandis que le parallélisme de pipeline sur TCP régresse.
vllm-metal à lui seul double le débit sur les deux charges de travail d'une concurrence de 1 à 16 sur Qwen3-0.6B.
Seules trois piles satisfont aux critères de complétude, de fidélité et de couverture des modèles.
Le parallélisme des tenseurs sur Thunderbolt RDMA passe à l'échelle tandis que le parallélisme de pipeline sur TCP régresse.