Tối ưu hóa hệ thống suy luận và tăng tốc độ xử lý cho mô hình ngôn ngữ lớn
Optimizing inference systems and accelerating execution for large language models
智谱 công bố GLM-5.3-Flash vận hành trên hơn 10.000 bộ tăng tốc AI nội địa, đạt mức tăng 3,2 lần về thông lượng nhờ tối ưu hóa tự động bằng tác nhân AI. Trong khi đó, các mô hình như DiffusionGemma và Ternary-Bonsai được tích hợp vào các framework vLLM và MLX.
3 tài khoản độc lập
23 bài
1 bài viết
2 lab
9.227 tương tác
sglangvllm