CONSONANCE.for your information
lundi 5 octobre 2026frenvi

En discussion

01 — inference 4 VOIX

Exécution de modèles à poids ouverts locaux sur du matériel informatique contraint

Running local open-weight models on constrained hardware devices

Des développeurs ont déployé un modèle ternaire de 27 milliards de paramètres à 1,72 bit par poids sur une seule carte graphique dotée de 12 Go de VRAM. De plus, des mises à jour ont intégré les noyaux Metal de llama.cpp dans transformers et ajouté le support de SGLang pour les modèles de génération d'images.

4 comptes indépendants 20 messages 3 labos 11 277 interactions
llama.cppllamaquantizationunslothgemma
@Alibaba_Qwen ses sujets sur X ↗
@emollick ses sujets sur X ↗
@teortaxesTex ses sujets sur X ↗
@vllm_project ses sujets sur X ↗
@ylecun ses sujets sur X ↗
@DogukanUrker ses sujets sur X ↗
@HuggingModels ses sujets sur X ↗
@NewsFromGoogle ses sujets sur X ↗
↑