Exécution de modèles à poids ouverts locaux sur du matériel informatique contraint
Running local open-weight models on constrained hardware devices
Des développeurs ont déployé un modèle ternaire de 27 milliards de paramètres à 1,72 bit par poids sur une seule carte graphique dotée de 12 Go de VRAM. De plus, des mises à jour ont intégré les noyaux Metal de llama.cpp dans transformers et ajouté le support de SGLang pour les modèles de génération d'images.
4 comptes indépendants
20 messages
3 labos
11 277 interactions
llama.cppllamaquantizationunslothgemma