Intermedio 10 minGLM

GLM 5.1 in locale: l'alternativa open-weight da conoscere

GLM 5.1 è l'ultima iterazione della famiglia di modelli open-weight di Zhipu AI, uno dei laboratori cinesi più attivi nel campo del self-hosting. Il modello è spesso messo in ombra da Qwen e Llama nelle discussioni francofone, a torto: in alcuni impieghi — codice, ragionamento strutturato, tool calling — è alla pari. Questa guida ti mostra come installare GLM 5.1 in locale con Ollama o llama.cpp, quanta VRAM consuma a seconda della quantizzazione, come se la cava in francese e con il codice, e dove si colloca rispetto a Qwen 3.5 e Gemma 4.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché GLM 5.1 in locale

Tre ragioni concrete spingono a provare GLM 5.1 piuttosto che un Qwen 3.5 o un Gemma 4 equivalente. Innanzitutto, la sua licenza permissiva: la versione open-weight (disponibile nelle varianti 9B e 32B) consente l'uso commerciale, cosa tutt'altro che scontata nell'ecosistema open-source. Poi, il tool calling nativo: GLM 5.1 è stato addestrato fin dall'inizio a chiamare strumenti, il che lo rende particolarmente adatto agli agenti locali senza dover ricorrere a espedienti nei prompt.

Infine, il rapporto qualità/dimensione: il 9B raggiunge il livello di un Gemma 4 12B su diversi benchmark di codice e ragionamento, il che lo rende una scelta interessante se hai a disposizione solo 12 GB di VRAM. Il 32B mira a un livello più alto e si posiziona nella categoria dei modelli da 24-35B come Qwen 3.8 27B o Mistral Small 24B.

i
In due parole
GLM 5.1 = un modello open-weight cinese serio, sottovalutato nel mondo francofono, particolarmente forte nella programmazione e nel tool calling. Ollama lo rende disponibile con un solo comando; llama.cpp è l'opzione se vuoi più controllo.

#Ciò che caratterizza GLM 5.1

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

GLM 5.1 mantiene l'architettura transformer densa delle versioni precedenti — niente Mixture-of-Experts qui, a differenza di Qwen 3.6 35B-A3B o DeepSeek V4. È una scelta che semplifica l'inferenza e garantisce che il throughput non crolli sulle domande che chiamano in causa esperti insoliti.

Dimensioni
9B e 32B in formato open-weight. Esiste una versione 100B+ ma è accessibile solo tramite API Zhipu, non scaricabile.
Contesto
Contesto di 128k token per entrambe le dimensioni, esteso a 1M tramite scaling YaRN sul 32B (con degradazione oltre 200k).
Tokenizer
Tokenizer bilingue cinese/inglese ottimizzato, con una discreta copertura del francese. Prevedere circa il 5% di token in più rispetto a un Mistral per un testo equivalente in francese.
Tool calling
Formato nativo compatibile con lo schema OpenAI tools. Non serve il prompt engineering per attivarlo: il modello sa quando chiamare una funzione.
Licenza
Licenza GLM (versione di Apache 2.0 con clausola di attribuzione). Uso commerciale autorizzato, redistribuzione con gli stessi termini.
Multimodale
Solo testo per i modelli open-weight 9B e 32B. La versione per la visione (GLM-V) è un modello separato, da scaricare a parte.
→
Perché non usare un MoE qui
Un modello denso da 32B è più semplice da mettere in funzione di un MoE da 35B-A3B: nessuna sorpresa nell'uso della VRAM legata al routing, nessuna forte variazione del throughput in base alla domanda. Se vuoi una velocità stabile e prevedibile, GLM 5.1 32B è più comodo da usare di un MoE equivalente.

#Prerequisiti

Ollama ≥ 0.5
Per la versione Ollama. Le build più vecchie non conoscono il template di chat GLM 5.1.
llama.cpp recente
Build del 2026 o successiva. Il supporto all'architettura GLM è stato stabilizzato alla fine del 2025.
Spazio su disco
6 GB per il 9B Q4, 19 GB per il 32B Q4. Raddoppia per Q8, quadruplica per FP16.
VRAM minima
8 GB per il 9B Q4, 24 GB per il 32B Q4. Con meno VRAM, parte del carico passa alla CPU e la velocità di generazione scende a 3-5 tok/s.
Driver GPU aggiornato
CUDA 12.x per NVIDIA, ROCm 6.x per AMD, Metal nativo per Apple Silicon.

#1. Installazione con Ollama

Ollama è il percorso più breve. Il modello è disponibile con il nome glm5.1 nella libreria ufficiale, con i tag abituali per dimensione e quantizzazione.

Pull e avvio diretto
ollama run glm5.1:9b

Per il 32B, la procedura è la stessa, ma considera diversi minuti per il download e almeno 24 GB di VRAM o di memoria unificata.

Tag utili
ollama pull glm5.1:9b           # alias de 9b-instruct-q4_K_M
ollama pull glm5.1:9b-q8_0      # qualité supérieure, +60% VRAM
ollama pull glm5.1:32b          # 32B Q4 par défaut
ollama pull glm5.1:32b-q5_K_M   # le sweet spot 32B sur 24 Go

Una volta scaricato il modello, l'endpoint di Ollama compatibile con OpenAI è in ascolto per impostazione predefinita su http://localhost:11434 e glm5.1 risponde come qualsiasi modello servito da Ollama.

i
Verificare che il modello rientri nella capacità della VRAM
Dopo il primo prompt, esegui ollama ps in un altro terminale. La colonna PROCESSOR deve mostrare 100% GPU. Se vedi 70% GPU / 30% CPU, significa che hai superato la capacità della VRAM — passa a una quantizzazione più aggressiva o scegli un modello di dimensioni inferiori.

#2. Installazione con llama.cpp

Con llama.cpp, si scarica un GGUF da Hugging Face e lo si esegue tramite CLI o tramite il server HTTP. È la soluzione da preferire se vuoi regolare con precisione la cache KV o il modello draft per la decodifica speculativa, oppure se usi una configurazione multi-GPU.

Download GGUF
# 9B en Q4_K_M (recommandé)
wget https://huggingface.co/zhipuai/glm-5.1-9b-chat-gguf/resolve/main/glm-5.1-9b-chat-Q4_K_M.gguf

# 32B en Q4_K_M
wget https://huggingface.co/zhipuai/glm-5.1-32b-chat-gguf/resolve/main/glm-5.1-32b-chat-Q4_K_M.gguf
Avvio in modalità server
./llama-server \
  -m glm-5.1-9b-chat-Q4_K_M.gguf \
  -c 16384 \
  -ngl 99 \
  -fa \
  --host 0.0.0.0 --port 8080
-c 16384
Finestra di contesto. 16k è un buon valore predefinito per il francese e il codice; aumentalo a 32k o più se hai abbastanza VRAM.
-ngl 99
Tutto sulla GPU. Imposta un valore più basso per trasferire alcuni layer sulla CPU se superi la memoria disponibile sulla GPU.
-fa
Flash Attention. Indispensabile oltre gli 8k per evitare che l'uso di memoria per la cache KV aumenti enormemente.
--host 0.0.0.0
Espone il server sulla rete. Imposta 127.0.0.1 se vuoi limitarlo alla macchina locale.
→
Quantizzazione della cache KV
Su GLM 5.1, --cache-type-k q8_0 --cache-type-v q8_0 dimezzano la memoria KV con una perdita di qualità quasi nulla. Indispensabile se miri a 64k+ di contesto su un 32B.

#3. VRAM per quantizzazione

I valori qui sotto includono i pesi + una cache KV per un contesto di 8k. Per aumentarlo a 32k o 128k, aggiungi da 2 a 8 GB in base alle dimensioni.

GLM 5.1 9B — Q4_K_M
≈ 6 GB di VRAM. Entra a malapena nella VRAM di una GTX 1660 da 6 GB, con più margine su RTX 3050/3060/4060 da 8 GB.
GLM 5.1 9B — Q5_K_M
≈ 7 GB di VRAM. Una scelta adatta già con 8 GB, con un po' di margine.
GLM 5.1 9B — Q8_0
≈ 10 GB di VRAM. Pensato per RTX 3060 da 12 GB, 4070 da 12 GB o Mac con 16 GB o più.
GLM 5.1 32B — Q4_K_M
≈ 19 GB VRAM. Punto ottimale: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio.
GLM 5.1 32B — Q5_K_M
≈ 23 GB di VRAM. Quasi al limite dei 24 GB; puntare a un Mac con almeno 48 GB o a una configurazione multi-GPU per avere margine.
GLM 5.1 32B — Q8_0
≈ 34 GB di VRAM. Riservato alla RTX 5090 da 32 GB, ai Mac Studio Ultra o alle configurazioni multi-GPU (2× 3090, 2× 4090).
!
La trappola della finestra di contesto da 128k
Abilitare la finestra massima aggiunge da 5 a 10 GB alla cache KV, a seconda delle dimensioni. Con il modello 32B Q5 e 24 GB disponibili, rientri nel limite con 8k, ma lo superi con 32k. Aumenta il contesto per gradi e monitora ollama ps o nvidia-smi.

#4. Qualità in francese e nella programmazione

GLM 5.1 è addestrato principalmente su testi in cinese e inglese, ma se la cava bene in francese: non al livello di un Mistral nativo, ma meglio di un Gemma 4 12B nella stessa classe di dimensioni. Gli errori tipici riguardano espressioni idiomatiche e alcune concordanze poco comuni; nulla che ostacoli l'uso come assistente generalista o il RAG.

Francese — 9B
Valido per riassunti, traduzioni e RAG su documenti in francese. Qualche anglicismo occasionale. Preferire una temperatura bassa (0,2–0,4) per ridurre al minimo le deviazioni.
Francese — 32B
Resa molto curata. Alla pari con Mistral Small 24B per la qualità di scrittura, leggermente al di sotto dei grandi modelli proprietari.
Codice — 9B
Eccellente per le sue dimensioni. Generazione di codice Python, JS, Go e Rust di qualità. Supera un Granite 4.2 8B generalista e tiene testa a Qwen 3.5 9B sul codice.
Codice — 32B
Molto performante. Su HumanEval, MBPP, MultiPL-E, si pone tra i primi modelli open-weight. Buono nel refactoring di file multipli grazie al contesto 128k.
Ragionamento
Ragionamento esplicito passo dopo passo se richiesto, senza un token speciale <think> come in DeepSeek R1. Il 32B si difende su AIME, GPQA, MATH.
Tool calling
Formato nativo compatibile con il formato tools di OpenAI. Il modello decide da solo di chiamare una funzione e formatta gli argomenti JSON senza errori.
→
Per programmare ogni giorno
Se il tuo obiettivo principale è l'assistenza nella programmazione, confronta GLM 5.1 9B con Qwen 3.5 9B sui tuoi compiti. Entrambi sono eccellenti, ma uno può adattarsi meglio al tuo linguaggio e al tuo stile. Nessun benchmark pubblico sostituisce 30 minuti di test sul tuo repo.

#5. GLM 5.1 vs Qwen 3.5 e Gemma 4

Tre famiglie open-weight occupano la stessa classe di dimensioni nel 2026: GLM 5.1, Qwen (3.5 9B / 3.8 27B) e Gemma 4 (12B / 26B-A4B). Ecco una tabella che presenta il confronto con onestà:

Velocità pura (tok/s)
Con la stessa dimensione e la stessa VRAM, GLM 5.1 si colloca nella stessa fascia di Qwen 3.5 denso e Gemma 4. Nessuna differenza significativa — la velocità dipende soprattutto dal backend (Ollama vs llama.cpp vs vLLM) e dalla GPU.
Qualità in francese
Mistral Small 24B nativo > Qwen 3.5 ≈ GLM 5.1 > Gemma 4 a dimensioni equivalenti. Se il francese è cruciale, Mistral resta davanti; GLM 5.1 è una solida seconda scelta open.
Codice
Qwen3-Coder 30B / Devstral 24B > GLM 5.1 ≈ Qwen 3.8 generalista > Gemma 4 a parità di dimensioni. GLM 5.1 32B è competitivo rispetto a Qwen 3.8 27B, leggermente indietro rispetto ai modelli specializzati nel codice.
Tool calling
GLM 5.1 ≈ Qwen 3.5 > Gemma 4. I primi due sono stati addestrati esplicitamente per l'uso degli strumenti; Gemma richiede un po' più di prompt engineering.
Contesto lungo
Qwen 3.5 256k nativo (Qwen 3.8 27B: 262k) > GLM 5.1 128k (1M tramite YaRN) > Gemma 4 128k. Per l'analisi di un'intera base di codice, Qwen mantiene un vantaggio.
Licenza
GLM (licenza simile ad Apache) ≈ Qwen (Apache 2.0 sulla maggior parte delle varianti) ≈ Gemma 4 (Apache 2.0 da aprile 2026). Tre licenze semplici per l'uso aziendale, dato che Gemma ha abbandonato la sua clausola personalizzata.
Ecosistema
Qwen > Gemma 4 > GLM 5.1. Qwen ha ormai il maggior numero di fine-tune della comunità, Gemma 4 segue da vicino, GLM 5.1 resta meno diffuso — meno varianti, meno tutorial in francese.
i
La nostra raccomandazione onesta
Se hai 12 GB di VRAM e vuoi provare qualcosa fuori dagli schemi: GLM 5.1 9B. Se vuoi il miglior modello generalista open con 24 GB: Qwen 3.8 27B o GLM 5.1 32B, a seconda di quale funziona meglio con i tuoi prompt. Se la comunità e il fine-tuning contano: Qwen 3.5 resta imbattibile per la quantità di opzioni derivate.

#Consigli e insidie

Prompt di sistema breve
GLM 5.1 segue bene i prompt di sistema, ma si satura un po' se gli dai un prompt di 800 parole. Punta a 200-400 parole, con un testo chiaro e strutturato.
Temperatura bassa per il francese
0,2-0,4 per minimizzare gli anglicismi e le anomalie di concordanza grammaticale. Al di sopra di 0,7, la qualità della scrittura in francese inizia a oscillare.
Token di stop
Il modello utilizza <|endoftext|> e <|user|> come delimitatori. Se scrivi un tuo client, aggiungi queste due stringhe ai token di stop per evitare che il modello continui a parlare da solo.
Streaming via Ollama
Gli endpoint /api/chat e /v1/chat/completions supportano stream=true. GLM 5.1 non presenta particolarità, a differenza di alcuni modelli MoE.
Fine-tuning LoRA
Il fine-tuning LoRA di GLM 5.1 9B è fattibile su una RTX 4090 da 24 GB con Unsloth. Il 32B richiede una configurazione multi-GPU o un Mac con abbondante memoria unificata.
Modelfile Ollama
Per fissare un prompt di sistema e dei parametri, crea un Modelfile basato su glm5.1:9b, poi esegui ollama create monassistant -f Modelfile. Il modello derivato appare in ollama list come qualsiasi altro.
!
Confusione con ChatGLM e GLM-4
Non confondere GLM 5.1 (architettura transformer densa moderna, uscita 2026) con ChatGLM (prima generazione, 2023) o GLM-4 (2024). I tag Ollama sono distinti (chatglm, glm4, glm5.1); controlla bene ciò che stai scaricando.

#Per approfondire

GLM 5.1 è attivo, hai i tuoi primi risultati. Alcune indicazioni per migliorare:

Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per scegliere con precisione il compromesso tra qualità e VRAM nei tuoi casi d'uso.
Qwen3.6 35B-A3B in locale: test e requisiti VRAM
Il concorrente diretto della famiglia Qwen, con architettura MoE. Confronto utile se hai dubbi.
Open WebUI con Ollama: guida completa
Un'interfaccia simile a ChatGPT basata su GLM 5.1: conversazioni, RAG, supporto multiutente.
Creare un agente IA locale in Python con LangChain e Ollama
Per sfruttare il tool calling nativo di GLM 5.1 e fargli chiamare le tue funzioni.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.