GLM-5 in locale con Ollama : il challenger open-weights
GLM-5 è la nuova famiglia open-weights di Zhipu AI (Università di Tsinghua). Versioni 9B e 32B, licenza permissiva, ragionamento solido, francese corretto e capacità di programmazione di tutto rispetto. Questa guida mostra come installare GLM-5 in locale con Ollama, misura le prestazioni reali su RTX 4070 e 4090 e lo confronta con Qwen3-32B e DeepSeek V3.2 sugli stessi compiti.
#Perché GLM-5?
GLM-5 non ha la notorietà di Qwen3 o DeepSeek, ma è uno dei modelli cinesi a pesi aperti più maturi usciti negli ultimi mesi. Il 9B si rivolge a configurazioni modeste (12 GB di VRAM sono sufficienti), il 32B si rivolge alle RTX 4090 e ai Mac Studio. Sulla carta, dichiara punteggi vicini a quelli di GPT-4o-mini su MMLU e HumanEval, con le stesse dimensioni di Qwen3-32B.
In pratica, GLM-5 eccelle su tre fronti: il ragionamento strutturato (modalità thinking simile a quella di Qwen3), il francese (sensibilmente migliore di Qwen3-9B su prompt complessi) e il codice Python. Là dove delude: la finestra di contesto si ferma a 128k in locale nonostante la promessa di 1M, e la visione non è integrata (a differenza di GLM-4V).
#Requisiti hardware
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- GLM-5 9B Q4_K_M
- ≈ 5,5 GB di VRAM. RTX 3060 12 GB, RTX 4060 8 GB (offload parziale), Mac M2 con 16 GB di memoria unificata, tutte le RTX 4070+.
- GLM-5 32B Q4_K_M
- ≈ 19 GB di VRAM. Una RTX 4090 da 24 GB offre un buon margine, così come una RTX 3090 da 24 GB. Con 16 GB (4080), bisogna scendere a Q3_K_M.
- GLM-5 32B Q5_K_M
- ≈ 22-23 GB VRAM. L'RTX 4090 ce la fa, ma con margine stretto. Preferisci Q4_K_M se attivi un contesto lungo.
- Ollama 0.6.0+
- Il supporto per GLM-5 è stato aggiunto progressivamente. È necessaria una versione recente per il tokenizer e il template di chat.
- Disco
- Prevedi da 6 GB (9B Q4) a 23 GB (32B Q5). Di più se conservi più quantizzazioni in parallelo.
#1. Recuperare il modello da Hugging Face
Zhipu AI pubblica i pesi ufficiali su Hugging Face sotto l'organizzazione THUDM. Due repository ti interessano:
Questi repository contengono i pesi nel formato safetensors (FP16/BF16). Per Ollama, ti serve il formato GGUF. Due opzioni: scaricare un GGUF già convertito dalla comunità oppure effettuare la conversione da solo.
#2. GGUF e conversione se necessario
Se nessun GGUF ufficiale o della comunità è adatto (variante esotica, quantizzazione specifica), la conversione passa per llama.cpp. La procedura standard:
#3. Installare GLM-5 in Ollama (locale)
Una volta in mano il GGUF, Ollama lo importa tramite un Modelfile. Crea un file chiamato Modelfile accanto al GGUF:
Poi crea il modello in Ollama, verifica che venga registrato e avvialo:
#4. Testare la qualità in francese
La qualità del francese di GLM-5 è uno dei suoi punti di forza per un modello addestrato prevalentemente su testi in cinese e inglese. Tre prompt utili per una valutazione rapida:
- 01Ragionamento strutturato« Una bottiglia e il suo tappo costano 1,10 €. La bottiglia costa 1 € di più del tappo. Quanto costa il tappo? Spiega il tuo ragionamento. » GLM-5 9B dovrebbe rispondere 0,05 € mostrando l'equazione.
- 02Sintesi di testi lunghiIncolla un articolo di 2000 parole e chiedi un riassunto in 5 punti chiave in francese. Il 32B mantiene un filo logico chiaro, mentre il 9B sintetizza troppo quando il contesto è lungo.
- 03Codice Python contestuale« Scrivi una funzione Python che analizza un CSV con separatore ;, gestisce le virgolette e restituisce un generatore di dizionari. Nessun pandas. » GLM-5 produce codice pulito e idiomatico, mentre Qwen3-9B tende a importare csv senza gestire correttamente le virgolette.
#5. Token/sec misurati su RTX 4070 e 4090
Misurazioni effettuate con Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contesto 8k, prompt di 500 token, generazione di 300 token. Media su 5 esecuzioni.
- RTX 4070 12 GB — GLM-5 9B Q4_K_M
- ≈ 55-60 token al secondo. Una velocità adeguata per la chat; il modello rimane al 100% in VRAM.
- RTX 4070 12 GB — GLM-5 9B Q5_K_M
- ≈ 48-52 token/sec. Leggero miglioramento di qualità, perdita di velocità misurata.
- RTX 4090 24 GB — GLM-5 9B Q4_K_M
- ≈ 110-120 token al secondo. Molto sovradimensionato per il 9B.
- RTX 4090 24 GB — GLM-5 32B Q4_K_M
- ≈ 22-26 token al secondo. Il caso d'uso previsto: qualità da modello 32B a una velocità sufficiente per un uso interattivo.
- RTX 4090 24 GB — GLM-5 32B Q5_K_M
- ≈ 18-22 token/sec. Margine di VRAM ridotto se il contesto > 16k.
- Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
- ≈ 12-15 token/sec. Accettabile per compiti non streaming (sintesi, analisi).
#GLM-5 vs Qwen3-32B vs DeepSeek V3.2
Con lo stesso prompt, sulla stessa macchina, ecco cosa si osserva in pratica. È una valutazione qualitativa, non un benchmark standardizzato — prendila come una bussola, non come una verità assoluta.
- Francese generale
- Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2 (in modalità rapida). Qwen3 resta in testa per la fluidità, GLM-5 è molto vicino, DeepSeek V3.2 ha più probabilità di generare allucinazioni in francese.
- Ragionamento strutturato
- GLM-5 32B (modalità thinking) ≈ Qwen3-32B (thinking). DeepSeek V3.2 è superiore se gli lasci attivare il ragionamento prolungato, ma con un costo in token da 3 a 5 volte maggiore.
- Codice Python
- Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B. Per un uso dedicato alla programmazione, resta su Qwen3-Coder. GLM-5 32B se la cava discretamente come modello generalista.
- Velocità a parità di VRAM (24 GB)
- GLM-5 32B Q4 ≈ Qwen3-32B Q4 (~25 tok/s). DeepSeek V3.2 non entra in 24 GB: è un MoE da 685B, fuori competizione per questa fascia.
- Spazio occupato su disco
- GLM-5 32B Q4 ≈ 19 GB. Qwen3-32B Q4 ≈ 20 GB. DeepSeek V3.2 ≈ 380 GB Q4 — fuori scala senza cluster.
#Risoluzione dei problemi
- Output incomprensibile o interamente in cinese
- Tokenizer convertito male o template errato. Verifica la versione di llama.cpp utilizzata per la conversione e che il Modelfile includa correttamente i tag <|user|>, <|assistant|>, [gMASK]<sop>.
- Token di stop ignorati (risposta infinita)
- Aggiungi PARAMETER stop "<|endoftext|>" e PARAMETER stop "<|user|>" nel Modelfile. Altrimenti, il modello può continuare a generare turni di dialogo fittizi.
- OOM in contesto lungo su RTX 4090
- La cache KV cresce a dismisura oltre i 32k. Attiva OLLAMA_KV_CACHE_TYPE=q8_0 (risparmio di circa il 40% della VRAM occupata dalla cache) o riduci num_ctx.
- Velocità < 10 tok/s con un 9B su una 4070
- Il modello è stato trasferito in parte nella RAM di sistema. Controlla con ollama ps: la colonna PROCESSOR deve mostrare 100 % GPU. Se compare CPU, riduci num_ctx o passa a Q3_K_M.
- Modalità thinking eccessivamente verbosa
- GLM-5 può generare lunghe catene di pensiero. Per interromperle, chiedi esplicitamente «risposta diretta senza ragionamento intermedio» nel prompt di sistema.
#GLM-5.2 è uscito: serve migrare?
Dal 13 giugno 2026, Zhipu propone GLM-5.2: circa 753B di parametri in MoE, licenza MIT, contesto 1M, progettato per agenti di programmazione che operano a lungo. Ad oggi è il modello «frontier» meglio supportato in locale — esistono versioni quantizzate GGUF (unsloth) sia per Ollama che per LM Studio. Metti in conto un Mac da 256 GB o una macchina con RTX 4090 usando la quantizzazione a 2 bit: se il tuo hardware era già adeguato per GLM-5, i passaggi di installazione di questa guida restano gli stessi, cambia solo il riferimento del modello.
#Per approfondire
Vale la pena investire un po' in GLM-5 per sfruttarlo al massimo. Tre strade utili:
- Scegliere la quantizzazione giusta
- Q4_K_M offre il miglior equilibrio come scelta predefinita, ma GLM-5 32B in Q5_K_M rientra in 24 GB con un contesto ragionevole e migliora notevolmente le prestazioni nella programmazione.
- Personalizza con Modelfile
- Prompt di sistema, template di risposta, parametri di sampling: un Modelfile ben configurato evita di ripetere le istruzioni in ogni sessione.
- Confrontare con Qwen3 in condizioni reali
- La guida Qwen3-32B vs GLM-5 (in arrivo) propone un protocollo di confronto su 30 prompt rappresentativi (FR, codice, ragionamento, sintesi).
Hardware consigliato: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — alternativa PC per i LLM quantizzati locali; non è il Mac del tutorial. Tutto l'hardware per l'IA →
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.