GLM 5.1 in locale: l'alternativa open-weight da conoscere
GLM 5.1 è l'ultima iterazione della famiglia di modelli open-weight di Zhipu AI, uno dei laboratori cinesi più attivi nel campo del self-hosting. Il modello è spesso messo in ombra da Qwen e Llama nelle discussioni francofone, a torto: in alcuni impieghi — codice, ragionamento strutturato, tool calling — è alla pari. Questa guida ti mostra come installare GLM 5.1 in locale con Ollama o llama.cpp, quanta VRAM consuma a seconda della quantizzazione, come se la cava in francese e con il codice, e dove si colloca rispetto a Qwen 3.5 e Gemma 4.
#Perché GLM 5.1 in locale
Tre ragioni concrete spingono a provare GLM 5.1 piuttosto che un Qwen 3.5 o un Gemma 4 equivalente. Innanzitutto, la sua licenza permissiva: la versione open-weight (disponibile nelle varianti 9B e 32B) consente l'uso commerciale, cosa tutt'altro che scontata nell'ecosistema open-source. Poi, il tool calling nativo: GLM 5.1 è stato addestrato fin dall'inizio a chiamare strumenti, il che lo rende particolarmente adatto agli agenti locali senza dover ricorrere a espedienti nei prompt.
Infine, il rapporto qualità/dimensione: il 9B raggiunge il livello di un Gemma 4 12B su diversi benchmark di codice e ragionamento, il che lo rende una scelta interessante se hai a disposizione solo 12 GB di VRAM. Il 32B mira a un livello più alto e si posiziona nella categoria dei modelli da 24-35B come Qwen 3.8 27B o Mistral Small 24B.
#Ciò che caratterizza GLM 5.1
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
GLM 5.1 mantiene l'architettura transformer densa delle versioni precedenti — niente Mixture-of-Experts qui, a differenza di Qwen 3.6 35B-A3B o DeepSeek V4. È una scelta che semplifica l'inferenza e garantisce che il throughput non crolli sulle domande che chiamano in causa esperti insoliti.
- Dimensioni
- 9B e 32B in formato open-weight. Esiste una versione 100B+ ma è accessibile solo tramite API Zhipu, non scaricabile.
- Contesto
- Contesto di 128k token per entrambe le dimensioni, esteso a 1M tramite scaling YaRN sul 32B (con degradazione oltre 200k).
- Tokenizer
- Tokenizer bilingue cinese/inglese ottimizzato, con una discreta copertura del francese. Prevedere circa il 5% di token in più rispetto a un Mistral per un testo equivalente in francese.
- Tool calling
- Formato nativo compatibile con lo schema OpenAI tools. Non serve il prompt engineering per attivarlo: il modello sa quando chiamare una funzione.
- Licenza
- Licenza GLM (versione di Apache 2.0 con clausola di attribuzione). Uso commerciale autorizzato, redistribuzione con gli stessi termini.
- Multimodale
- Solo testo per i modelli open-weight 9B e 32B. La versione per la visione (GLM-V) è un modello separato, da scaricare a parte.
#Prerequisiti
- Ollama ≥ 0.5
- Per la versione Ollama. Le build più vecchie non conoscono il template di chat GLM 5.1.
- llama.cpp recente
- Build del 2026 o successiva. Il supporto all'architettura GLM è stato stabilizzato alla fine del 2025.
- Spazio su disco
- 6 GB per il 9B Q4, 19 GB per il 32B Q4. Raddoppia per Q8, quadruplica per FP16.
- VRAM minima
- 8 GB per il 9B Q4, 24 GB per il 32B Q4. Con meno VRAM, parte del carico passa alla CPU e la velocità di generazione scende a 3-5 tok/s.
- Driver GPU aggiornato
- CUDA 12.x per NVIDIA, ROCm 6.x per AMD, Metal nativo per Apple Silicon.
#1. Installazione con Ollama
Ollama è il percorso più breve. Il modello è disponibile con il nome glm5.1 nella libreria ufficiale, con i tag abituali per dimensione e quantizzazione.
Per il 32B, la procedura è la stessa, ma considera diversi minuti per il download e almeno 24 GB di VRAM o di memoria unificata.
Una volta scaricato il modello, l'endpoint di Ollama compatibile con OpenAI è in ascolto per impostazione predefinita su http://localhost:11434 e glm5.1 risponde come qualsiasi modello servito da Ollama.
#2. Installazione con llama.cpp
Con llama.cpp, si scarica un GGUF da Hugging Face e lo si esegue tramite CLI o tramite il server HTTP. È la soluzione da preferire se vuoi regolare con precisione la cache KV o il modello draft per la decodifica speculativa, oppure se usi una configurazione multi-GPU.
- -c 16384
- Finestra di contesto. 16k è un buon valore predefinito per il francese e il codice; aumentalo a 32k o più se hai abbastanza VRAM.
- -ngl 99
- Tutto sulla GPU. Imposta un valore più basso per trasferire alcuni layer sulla CPU se superi la memoria disponibile sulla GPU.
- -fa
- Flash Attention. Indispensabile oltre gli 8k per evitare che l'uso di memoria per la cache KV aumenti enormemente.
- --host 0.0.0.0
- Espone il server sulla rete. Imposta 127.0.0.1 se vuoi limitarlo alla macchina locale.
#3. VRAM per quantizzazione
I valori qui sotto includono i pesi + una cache KV per un contesto di 8k. Per aumentarlo a 32k o 128k, aggiungi da 2 a 8 GB in base alle dimensioni.
- GLM 5.1 9B — Q4_K_M
- ≈ 6 GB di VRAM. Entra a malapena nella VRAM di una GTX 1660 da 6 GB, con più margine su RTX 3050/3060/4060 da 8 GB.
- GLM 5.1 9B — Q5_K_M
- ≈ 7 GB di VRAM. Una scelta adatta già con 8 GB, con un po' di margine.
- GLM 5.1 9B — Q8_0
- ≈ 10 GB di VRAM. Pensato per RTX 3060 da 12 GB, 4070 da 12 GB o Mac con 16 GB o più.
- GLM 5.1 32B — Q4_K_M
- ≈ 19 GB VRAM. Punto ottimale: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio.
- GLM 5.1 32B — Q5_K_M
- ≈ 23 GB di VRAM. Quasi al limite dei 24 GB; puntare a un Mac con almeno 48 GB o a una configurazione multi-GPU per avere margine.
- GLM 5.1 32B — Q8_0
- ≈ 34 GB di VRAM. Riservato alla RTX 5090 da 32 GB, ai Mac Studio Ultra o alle configurazioni multi-GPU (2× 3090, 2× 4090).
#4. Qualità in francese e nella programmazione
GLM 5.1 è addestrato principalmente su testi in cinese e inglese, ma se la cava bene in francese: non al livello di un Mistral nativo, ma meglio di un Gemma 4 12B nella stessa classe di dimensioni. Gli errori tipici riguardano espressioni idiomatiche e alcune concordanze poco comuni; nulla che ostacoli l'uso come assistente generalista o il RAG.
- Francese — 9B
- Valido per riassunti, traduzioni e RAG su documenti in francese. Qualche anglicismo occasionale. Preferire una temperatura bassa (0,2–0,4) per ridurre al minimo le deviazioni.
- Francese — 32B
- Resa molto curata. Alla pari con Mistral Small 24B per la qualità di scrittura, leggermente al di sotto dei grandi modelli proprietari.
- Codice — 9B
- Eccellente per le sue dimensioni. Generazione di codice Python, JS, Go e Rust di qualità. Supera un Granite 4.2 8B generalista e tiene testa a Qwen 3.5 9B sul codice.
- Codice — 32B
- Molto performante. Su HumanEval, MBPP, MultiPL-E, si pone tra i primi modelli open-weight. Buono nel refactoring di file multipli grazie al contesto 128k.
- Ragionamento
- Ragionamento esplicito passo dopo passo se richiesto, senza un token speciale <think> come in DeepSeek R1. Il 32B si difende su AIME, GPQA, MATH.
- Tool calling
- Formato nativo compatibile con il formato tools di OpenAI. Il modello decide da solo di chiamare una funzione e formatta gli argomenti JSON senza errori.
#5. GLM 5.1 vs Qwen 3.5 e Gemma 4
Tre famiglie open-weight occupano la stessa classe di dimensioni nel 2026: GLM 5.1, Qwen (3.5 9B / 3.8 27B) e Gemma 4 (12B / 26B-A4B). Ecco una tabella che presenta il confronto con onestà:
- Velocità pura (tok/s)
- Con la stessa dimensione e la stessa VRAM, GLM 5.1 si colloca nella stessa fascia di Qwen 3.5 denso e Gemma 4. Nessuna differenza significativa — la velocità dipende soprattutto dal backend (Ollama vs llama.cpp vs vLLM) e dalla GPU.
- Qualità in francese
- Mistral Small 24B nativo > Qwen 3.5 ≈ GLM 5.1 > Gemma 4 a dimensioni equivalenti. Se il francese è cruciale, Mistral resta davanti; GLM 5.1 è una solida seconda scelta open.
- Codice
- Qwen3-Coder 30B / Devstral 24B > GLM 5.1 ≈ Qwen 3.8 generalista > Gemma 4 a parità di dimensioni. GLM 5.1 32B è competitivo rispetto a Qwen 3.8 27B, leggermente indietro rispetto ai modelli specializzati nel codice.
- Tool calling
- GLM 5.1 ≈ Qwen 3.5 > Gemma 4. I primi due sono stati addestrati esplicitamente per l'uso degli strumenti; Gemma richiede un po' più di prompt engineering.
- Contesto lungo
- Qwen 3.5 256k nativo (Qwen 3.8 27B: 262k) > GLM 5.1 128k (1M tramite YaRN) > Gemma 4 128k. Per l'analisi di un'intera base di codice, Qwen mantiene un vantaggio.
- Licenza
- GLM (licenza simile ad Apache) ≈ Qwen (Apache 2.0 sulla maggior parte delle varianti) ≈ Gemma 4 (Apache 2.0 da aprile 2026). Tre licenze semplici per l'uso aziendale, dato che Gemma ha abbandonato la sua clausola personalizzata.
- Ecosistema
- Qwen > Gemma 4 > GLM 5.1. Qwen ha ormai il maggior numero di fine-tune della comunità, Gemma 4 segue da vicino, GLM 5.1 resta meno diffuso — meno varianti, meno tutorial in francese.
#Consigli e insidie
- Prompt di sistema breve
- GLM 5.1 segue bene i prompt di sistema, ma si satura un po' se gli dai un prompt di 800 parole. Punta a 200-400 parole, con un testo chiaro e strutturato.
- Temperatura bassa per il francese
- 0,2-0,4 per minimizzare gli anglicismi e le anomalie di concordanza grammaticale. Al di sopra di 0,7, la qualità della scrittura in francese inizia a oscillare.
- Token di stop
- Il modello utilizza <|endoftext|> e <|user|> come delimitatori. Se scrivi un tuo client, aggiungi queste due stringhe ai token di stop per evitare che il modello continui a parlare da solo.
- Streaming via Ollama
- Gli endpoint /api/chat e /v1/chat/completions supportano stream=true. GLM 5.1 non presenta particolarità, a differenza di alcuni modelli MoE.
- Fine-tuning LoRA
- Il fine-tuning LoRA di GLM 5.1 9B è fattibile su una RTX 4090 da 24 GB con Unsloth. Il 32B richiede una configurazione multi-GPU o un Mac con abbondante memoria unificata.
- Modelfile Ollama
- Per fissare un prompt di sistema e dei parametri, crea un Modelfile basato su glm5.1:9b, poi esegui ollama create monassistant -f Modelfile. Il modello derivato appare in ollama list come qualsiasi altro.
#Per approfondire
GLM 5.1 è attivo, hai i tuoi primi risultati. Alcune indicazioni per migliorare:
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per scegliere con precisione il compromesso tra qualità e VRAM nei tuoi casi d'uso.
- Qwen3.6 35B-A3B in locale: test e requisiti VRAM
- Il concorrente diretto della famiglia Qwen, con architettura MoE. Confronto utile se hai dubbi.
- Open WebUI con Ollama: guida completa
- Un'interfaccia simile a ChatGPT basata su GLM 5.1: conversazioni, RAG, supporto multiutente.
- Creare un agente IA locale in Python con LangChain e Ollama
- Per sfruttare il tool calling nativo di GLM 5.1 e fargli chiamare le tue funzioni.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.