Intermedio 11 minOllama

GLM-5 in locale con Ollama : il challenger open-weights

GLM-5 è la nuova famiglia open-weights di Zhipu AI (Università di Tsinghua). Versioni 9B e 32B, licenza permissiva, ragionamento solido, francese corretto e capacità di programmazione di tutto rispetto. Questa guida mostra come installare GLM-5 in locale con Ollama, misura le prestazioni reali su RTX 4070 e 4090 e lo confronta con Qwen3-32B e DeepSeek V3.2 sugli stessi compiti.

Di Mohamed Meguedmi·Agg. 2026-08-11·Testato su Windows, macOS e Linux

#Perché GLM-5?

GLM-5 non ha la notorietà di Qwen3 o DeepSeek, ma è uno dei modelli cinesi a pesi aperti più maturi usciti negli ultimi mesi. Il 9B si rivolge a configurazioni modeste (12 GB di VRAM sono sufficienti), il 32B si rivolge alle RTX 4090 e ai Mac Studio. Sulla carta, dichiara punteggi vicini a quelli di GPT-4o-mini su MMLU e HumanEval, con le stesse dimensioni di Qwen3-32B.

In pratica, GLM-5 eccelle su tre fronti: il ragionamento strutturato (modalità thinking simile a quella di Qwen3), il francese (sensibilmente migliore di Qwen3-9B su prompt complessi) e il codice Python. Là dove delude: la finestra di contesto si ferma a 128k in locale nonostante la promessa di 1M, e la visione non è integrata (a differenza di GLM-4V).

i
GLM-5 vs GLM 5.1
Questa guida tratta GLM-5 (versione iniziale). GLM 5.1 (uscito successivamente) corregge diverse regressioni nella programmazione e migliora la capacità di seguire le istruzioni. Se parti da zero oggi, leggi anche la guida a GLM 5.1 del sito prima di scegliere.

#Requisiti hardware

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
GLM-5 9B Q4_K_M
≈ 5,5 GB di VRAM. RTX 3060 12 GB, RTX 4060 8 GB (offload parziale), Mac M2 con 16 GB di memoria unificata, tutte le RTX 4070+.
GLM-5 32B Q4_K_M
≈ 19 GB di VRAM. Una RTX 4090 da 24 GB offre un buon margine, così come una RTX 3090 da 24 GB. Con 16 GB (4080), bisogna scendere a Q3_K_M.
GLM-5 32B Q5_K_M
≈ 22-23 GB VRAM. L'RTX 4090 ce la fa, ma con margine stretto. Preferisci Q4_K_M se attivi un contesto lungo.
Ollama 0.6.0+
Il supporto per GLM-5 è stato aggiunto progressivamente. È necessaria una versione recente per il tokenizer e il template di chat.
Disco
Prevedi da 6 GB (9B Q4) a 23 GB (32B Q5). Di più se conservi più quantizzazioni in parallelo.

#1. Recuperare il modello da Hugging Face

Zhipu AI pubblica i pesi ufficiali su Hugging Face sotto l'organizzazione THUDM. Due repository ti interessano:

Repository ufficiale 9B
https://huggingface.co/THUDM/glm-5-9b-chat
Repository ufficiale 32B
https://huggingface.co/THUDM/glm-5-32b-chat

Questi repository contengono i pesi nel formato safetensors (FP16/BF16). Per Ollama, ti serve il formato GGUF. Due opzioni: scaricare un GGUF già convertito dalla comunità oppure effettuare la conversione da solo.

→
Scorciatoia: GGUF già pronto
Cerca su Hugging Face glm-5 GGUF — bartowski, mradermacher e lmstudio-community pubblicano conversioni Q4_K_M, Q5_K_M e Q8_0 aggiornate. È l'opzione pratica per il 95% dei casi.

#2. GGUF e conversione se necessario

Se nessun GGUF ufficiale o della comunità è adatto (variante esotica, quantizzazione specifica), la conversione passa per llama.cpp. La procedura standard:

Clonare llama.cpp e installare le dipendenze
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
pip install -r requirements.txt
Convertire HF → GGUF FP16
python convert_hf_to_gguf.py /chemin/vers/glm-5-9b-chat \
  --outfile glm-5-9b-chat-f16.gguf \
  --outtype f16
Quantizzare in Q4_K_M
./build/bin/llama-quantize \
  glm-5-9b-chat-f16.gguf \
  glm-5-9b-chat-Q4_K_M.gguf \
  Q4_K_M
!
Tokenizer GLM
GLM utilizza un tokenizer SentencePiece derivato. Se convert_hf_to_gguf.py segnala la mancanza di token speciali, aggiorna llama.cpp (il supporto per GLM-5 è stato aggiunto in una PR recente). Con una versione troppo vecchia, la conversione riesce ma l'inferenza produce testo incomprensibile.

#3. Installare GLM-5 in Ollama (locale)

Una volta in mano il GGUF, Ollama lo importa tramite un Modelfile. Crea un file chiamato Modelfile accanto al GGUF:

Modelfile per GLM-5 9B
FROM ./glm-5-9b-chat-Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER num_ctx 32768
PARAMETER stop "<|user|>"
PARAMETER stop "<|endoftext|>"

TEMPLATE """[gMASK]<sop>{{ if .System }}<|system|>
{{ .System }}{{ end }}<|user|>
{{ .Prompt }}<|assistant|>
{{ .Response }}"""

SYSTEM """Tu es un assistant utile, précis et concis. Tu réponds en français sauf demande contraire."""

Poi crea il modello in Ollama, verifica che venga registrato e avvialo:

Creazione e avvio
ollama create glm5-9b -f Modelfile
ollama list
ollama run glm5-9b
→
Quando arriverà il supporto nativo
Se Ollama pubblica GLM-5 nel suo registry ufficiale (ollama run glm5 senza Modelfile), preferisci questa versione: il template della chat sarà mantenuto a monte ed eviterai gli errori relativi ai token di arresto.

#4. Testare la qualità in francese

La qualità del francese di GLM-5 è uno dei suoi punti di forza per un modello addestrato prevalentemente su testi in cinese e inglese. Tre prompt utili per una valutazione rapida:

  1. 01
    Ragionamento strutturato
    « Una bottiglia e il suo tappo costano 1,10 €. La bottiglia costa 1 € di più del tappo. Quanto costa il tappo? Spiega il tuo ragionamento. » GLM-5 9B dovrebbe rispondere 0,05 € mostrando l'equazione.
  2. 02
    Sintesi di testi lunghi
    Incolla un articolo di 2000 parole e chiedi un riassunto in 5 punti chiave in francese. Il 32B mantiene un filo logico chiaro, mentre il 9B sintetizza troppo quando il contesto è lungo.
  3. 03
    Codice Python contestuale
    « Scrivi una funzione Python che analizza un CSV con separatore ;, gestisce le virgolette e restituisce un generatore di dizionari. Nessun pandas. » GLM-5 produce codice pulito e idiomatico, mentre Qwen3-9B tende a importare csv senza gestire correttamente le virgolette.
i
Modalità thinking
GLM-5 ha una modalità di catena di pensiero attivabile tramite un prefisso di sistema (consulta la scheda del modello su HF per il formato esatto). Quando è attiva, la qualità del ragionamento migliora di un livello, al prezzo di circa il 30–40% di token in più.

#5. Token/sec misurati su RTX 4070 e 4090

Misurazioni effettuate con Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contesto 8k, prompt di 500 token, generazione di 300 token. Media su 5 esecuzioni.

RTX 4070 12 GB — GLM-5 9B Q4_K_M
≈ 55-60 token al secondo. Una velocità adeguata per la chat; il modello rimane al 100% in VRAM.
RTX 4070 12 GB — GLM-5 9B Q5_K_M
≈ 48-52 token/sec. Leggero miglioramento di qualità, perdita di velocità misurata.
RTX 4090 24 GB — GLM-5 9B Q4_K_M
≈ 110-120 token al secondo. Molto sovradimensionato per il 9B.
RTX 4090 24 GB — GLM-5 32B Q4_K_M
≈ 22-26 token al secondo. Il caso d'uso previsto: qualità da modello 32B a una velocità sufficiente per un uso interattivo.
RTX 4090 24 GB — GLM-5 32B Q5_K_M
≈ 18-22 token/sec. Margine di VRAM ridotto se il contesto > 16k.
Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
≈ 12-15 token/sec. Accettabile per compiti non streaming (sintesi, analisi).
→
Attiva Flash Attention
Impostare OLLAMA_FLASH_ATTENTION=1 nell'ambiente consente un guadagno del 10-15% su GLM-5 32B e stabilizza la VRAM con contesti lunghi. Abbinando questa impostazione a OLLAMA_KV_CACHE_TYPE=q8_0, liberi altri 2-3 GB senza degrado visibile.

#GLM-5 vs Qwen3-32B vs DeepSeek V3.2

Con lo stesso prompt, sulla stessa macchina, ecco cosa si osserva in pratica. È una valutazione qualitativa, non un benchmark standardizzato — prendila come una bussola, non come una verità assoluta.

Francese generale
Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2 (in modalità rapida). Qwen3 resta in testa per la fluidità, GLM-5 è molto vicino, DeepSeek V3.2 ha più probabilità di generare allucinazioni in francese.
Ragionamento strutturato
GLM-5 32B (modalità thinking) ≈ Qwen3-32B (thinking). DeepSeek V3.2 è superiore se gli lasci attivare il ragionamento prolungato, ma con un costo in token da 3 a 5 volte maggiore.
Codice Python
Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B. Per un uso dedicato alla programmazione, resta su Qwen3-Coder. GLM-5 32B se la cava discretamente come modello generalista.
Velocità a parità di VRAM (24 GB)
GLM-5 32B Q4 ≈ Qwen3-32B Q4 (~25 tok/s). DeepSeek V3.2 non entra in 24 GB: è un MoE da 685B, fuori competizione per questa fascia.
Spazio occupato su disco
GLM-5 32B Q4 ≈ 19 GB. Qwen3-32B Q4 ≈ 20 GB. DeepSeek V3.2 ≈ 380 GB Q4 — fuori scala senza cluster.
i
Verdetto pratico
Se hai 24 GB di VRAM e vuoi un modello 32B generalista, la scelta è tra GLM-5 e Qwen3. GLM-5 è più interessante per il ragionamento strutturato e per esplorare un'alternativa meno convenzionale, mentre Qwen3-32B resta una scelta affidabile. DeepSeek V3.2 resta un modello da usare tramite API o su un server di grandi dimensioni — con 24 GB non è un'opzione.

#Risoluzione dei problemi

Output incomprensibile o interamente in cinese
Tokenizer convertito male o template errato. Verifica la versione di llama.cpp utilizzata per la conversione e che il Modelfile includa correttamente i tag <|user|>, <|assistant|>, [gMASK]<sop>.
Token di stop ignorati (risposta infinita)
Aggiungi PARAMETER stop "<|endoftext|>" e PARAMETER stop "<|user|>" nel Modelfile. Altrimenti, il modello può continuare a generare turni di dialogo fittizi.
OOM in contesto lungo su RTX 4090
La cache KV cresce a dismisura oltre i 32k. Attiva OLLAMA_KV_CACHE_TYPE=q8_0 (risparmio di circa il 40% della VRAM occupata dalla cache) o riduci num_ctx.
Velocità < 10 tok/s con un 9B su una 4070
Il modello è stato trasferito in parte nella RAM di sistema. Controlla con ollama ps: la colonna PROCESSOR deve mostrare 100 % GPU. Se compare CPU, riduci num_ctx o passa a Q3_K_M.
Modalità thinking eccessivamente verbosa
GLM-5 può generare lunghe catene di pensiero. Per interromperle, chiedi esplicitamente «risposta diretta senza ragionamento intermedio» nel prompt di sistema.

#GLM-5.2 è uscito: serve migrare?

Dal 13 giugno 2026, Zhipu propone GLM-5.2: circa 753B di parametri in MoE, licenza MIT, contesto 1M, progettato per agenti di programmazione che operano a lungo. Ad oggi è il modello «frontier» meglio supportato in locale — esistono versioni quantizzate GGUF (unsloth) sia per Ollama che per LM Studio. Metti in conto un Mac da 256 GB o una macchina con RTX 4090 usando la quantizzazione a 2 bit: se il tuo hardware era già adeguato per GLM-5, i passaggi di installazione di questa guida restano gli stessi, cambia solo il riferimento del modello.

i
Guida dedicata in arrivo
Una guida completa a GLM-5.2 (installazione con Ollama + LM Studio, configurazioni realistiche, aspettative oneste sulle velocità) è in preparazione e sarà pubblicata questa settimana sul sito.

#Per approfondire

Vale la pena investire un po' in GLM-5 per sfruttarlo al massimo. Tre strade utili:

Scegliere la quantizzazione giusta
Q4_K_M offre il miglior equilibrio come scelta predefinita, ma GLM-5 32B in Q5_K_M rientra in 24 GB con un contesto ragionevole e migliora notevolmente le prestazioni nella programmazione.
Personalizza con Modelfile
Prompt di sistema, template di risposta, parametri di sampling: un Modelfile ben configurato evita di ripetere le istruzioni in ogni sessione.
Confrontare con Qwen3 in condizioni reali
La guida Qwen3-32B vs GLM-5 (in arrivo) propone un protocollo di confronto su 30 prompt rappresentativi (FR, codice, ragionamento, sintesi).

Hardware consigliato: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — alternativa PC per i LLM quantizzati locali; non è il Mac del tutorial. Tutto l'hardware per l'IA →

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.