Home › Recensioni e test › GLM Coding Plan
GLM Coding Plan: il nostro parere dopo il test
Accesso API ai modelli GLM, pensato per gli assistenti di programmazione — offerto dal laboratorio che pubblica i propri pesi come open-weights.
Il migliore rapporto qualità/prezzo attuale per collegare un assistente di programmazione a un grande modello — proprio perché i pesi sono aperti e mantieni un'alternativa locale. La riserva è reale: le quote di utilizzo del piano sono giudicate poco trasparenti da una parte degli abbonati.

Che cos'è, esattamente?
GLM è la famiglia di modelli del laboratorio cinese Zhipu AI (marca internazionale: Z.ai), quotato a Hong Kong dal gennaio 2026. La sua particolarità, e la ragione per cui questo sito ne parla da mesi: i pesi sono pubblicati in open-weights. GLM-5, GLM-5.1, GLM-5.2 sono presenti nel nostro catalogo, con le loro esigenze VRAM.
Il Coding Plan è l'abbonamento API orientato alla programmazione: espone i modelli GLM attraverso un protocollo compatibile con gli assistenti esistenti (Claude Code, Cline, Roo Code), a un costo nettamente inferiore rispetto alle API americane equivalenti. L'idea è semplice: il tuo strumento di programmazione non nota la differenza, la tua fattura sì.
Il nostro test: i limiti del GLM locale su una GPU consumer
Prima di valutare l'API, abbiamo spinto l'opzione locale fino al suo limite, sulla nostra macchina di test (RTX 5070 Ti 12 GB + Intel Core Ultra 9 275HX, CachyOS, Ollama). È proprio questo il vantaggio di una famiglia open-weights: la domanda non è «API o niente», ma «a partire da quale punto l'API diventa necessaria». Una risposta basata su misurazioni, con numeri a supporto:
| Misura (26/08/2026) | Risultato |
|---|---|
| Modello testato localmente | GLM-4.7-flash (quantizzato q4) |
| Peso in memoria | 20 GB — per 12 GB di VRAM: offload 47 % CPU / 53 % GPU |
| Generazione (attività di programmazione in Python) | 35 token/s — sorprendentemente scorrevole |
| Elaborazione del prompt (prefill) | 5,8 token/s — il vero collo di bottiglia |
| Caricamento del modello | 25 s |
La misurazione offre un quadro più sfumato di «non ci sta»: anche con metà del modello trasferita alla CPU, il modello genera a 35 token/s — una velocità confortevole per la chat. Ma il elaborazione del prompt non supera i 5,8 token/s: inviare un file di 2.000 token da analizzare richiede già più di cinque minuti di silenzio prima della prima parola. Un assistente di codice passa il tempo a fare esattamente questo — rileggere i tuoi file a ogni iterazione.
Conclusione inequivocabile: su una GPU di fascia consumer da 12 GB, questa famiglia di modelli è inutilizzabile come agente di programmazione locale, non per la generazione ma per il prefill. È proprio questa lacuna che il Coding Plan colma: la stessa famiglia di modelli, servita con un prefill istantaneo, mentre la tua GPU rimane libera. E se hai 24 GB di VRAM o più, rifai il calcolo — il configuratore ti fornisce il calcolo per la tua macchina.
Prezzi
Il Coding Plan è disponibile in diversi livelli (dal piano base per un uso individuale al livello «Max» per un uso intensivo con più agenti). I prezzi rilevati ad agosto 2026 vanno da pochi dollari al mese per il piano base a qualche decina di dollari per i livelli superiori — cioè un ordine di grandezza al di sotto degli abbonamenti equivalenti di Anthropic o OpenAI. Z.ai propone spesso promozioni sul primo mese: verifica il prezzo attuale prima di abbonarti, perché cambia rapidamente.
Punti di forza e riserve
- Pesi aperti = nessun lock-in: i tuoi prompt, il tuo workflow e persino il modello rimangono recuperabili in locale
- Compatibile con gli assistenti di codice esistenti (Claude Code, Cline, Roo Code) senza dover cambiare strumento
- Prezzo di ingresso molto inferiore rispetto alle API americane equivalenti
- Azienda solida: Zhipu AI, quotata a Hong Kong, uno dei principali laboratori nel settore dei modelli aperti
- Quote giudicate poco trasparenti da una parte degli abbonati (« 3× Claude » contestato nelle ore di punta) — Trustpilot 2,1/5 su 32 recensioni ad agosto 2026, monitora il tuo consumo durante la prima settimana
- Assistenza clienti lenta secondo gli stessi riscontri
- Le tue richieste passano attraverso i server di Z.ai: una soluzione da escludere per il codice soggetto a NDA — questo vale per qualsiasi API, ed è per questo che l'esecuzione in locale rimane il nostro punto di riferimento
Domande frequenti
È possibile usare GLM gratuitamente?
Sì. I modelli GLM sono pubblicati con pesi aperti: le varianti quantizzate si scaricano e si eseguono gratuitamente con Ollama o LM Studio, a condizione che la tua VRAM sia sufficiente. L'abbonamento riguarda solo l'accesso API alle varianti complete, offerte sull'infrastruttura di Z.ai.
Il GLM Coding Plan funziona con Claude Code?
Sì, è il suo principale punto di forza: l'API espone un protocollo compatibile, basta configurare lo strumento affinché usi l'endpoint di Z.ai. Anche Cline e Roo Code sono supportati. La configurazione richiede pochi minuti.
Le quote annunciate sono affidabili?
È la principale criticità documentata. Una parte degli abbonati segnala un consumo della quota più rapido di quanto annunciato nelle ore di punta, e la valutazione del servizio su Trustpilot ne risente (2,1/5 su un piccolo campione di 32 recensioni). Il nostro consiglio: scegli il piano base, misura una settimana di utilizzo reale, poi decidi.
Dove vanno i miei dati con questo piano?
Le tue richieste vengono elaborate sui server di Z.ai. Per codice proprietario soggetto a un NDA o dati regolamentati, la regola non cambia: rimani su un modello locale — cosa possibile proprio con questa famiglia, poiché i pesi sono aperti.
Che tipo di macchina serve per eseguire GLM localmente?
Le piccole varianti quantizzate si eseguono su GPU da 8 a 12 GB. Le varianti MoE recenti (GLM-4.7-flash: ~20 GB caricato in q4, misurato sulla nostra macchina) richiedono di più — è misurabile nel nostro configuratore, che ti dice esattamente cosa la tua macchina può sopportare.
Le altre recensioni della selezione
Trascrizione, sottotitoli e traduzione con IA, con revisione umana opzionale — la società europea meglio valutata della nostra selezione.
Leggi la recensione →Trasformare una conversazione in un agente riutilizzabile, collegato ai tuoi strumenti — senza scrivere codice.
Leggi la recensione →Bootcamp online — data science & IA, cybersecurity, UX e sviluppo web — con accreditamento di qualità tedesco.
Leggi la recensione →Trasparenza. Il link «Vedi GLM Coding Plan» è un link affiliato (piattaforma Impact.com). In caso di abbonamento, QualeLLM riceve una commissione versata dal marchio, senza costi aggiuntivi per te. Questa commissione non influenza né il voto né il contenuto: l'alternativa locale gratuita è citata prima del link d'acquisto e le riserve emerse dalle recensioni dei clienti sono pubblicate tali e quali. Metodologia completa · Note legali.