Home › Recensioni e test › GLM Coding Plan

GLM Coding Plan: il nostro parere dopo il test

Accesso API ai modelli GLM, pensato per gli assistenti di programmazione — offerto dal laboratorio che pubblica i propri pesi come open-weights.

Aggiornato il 26 agosto 2026 · da Mohamed Meguedmi · Contiene link affiliati

4
/ 5
Il nostro giudizio

Il migliore rapporto qualità/prezzo attuale per collegare un assistente di programmazione a un grande modello — proprio perché i pesi sono aperti e mantieni un'alternativa locale. La riserva è reale: le quote di utilizzo del piano sono giudicate poco trasparenti da una parte degli abbonati.

Per chiSviluppatori che usano Claude Code, Cline o Roo Code e vogliono un grande modello per la programmazione senza i costi delle API americane; utenti che eseguono GLM in locale e si scontrano con il limite della VRAM.
Lascia perdere seCodice soggetto a un NDA rigoroso (le richieste transitano attraverso i server di Z.ai — usa una soluzione locale); utenti che desiderano una quota garantita contrattualmente.
Pagina iniziale del GLM Coding Plan su z.ai: «Descrivete le vostre esigenze nel terminale o nell'IDE e lasciate che GLM si occupi del resto»
GLM Coding Plan — schermata del 26 agosto 2026

Che cos'è, esattamente?

GLM è la famiglia di modelli del laboratorio cinese Zhipu AI (marca internazionale: Z.ai), quotato a Hong Kong dal gennaio 2026. La sua particolarità, e la ragione per cui questo sito ne parla da mesi: i pesi sono pubblicati in open-weights. GLM-5, GLM-5.1, GLM-5.2 sono presenti nel nostro catalogo, con le loro esigenze VRAM.

Il Coding Plan è l'abbonamento API orientato alla programmazione: espone i modelli GLM attraverso un protocollo compatibile con gli assistenti esistenti (Claude Code, Cline, Roo Code), a un costo nettamente inferiore rispetto alle API americane equivalenti. L'idea è semplice: il tuo strumento di programmazione non nota la differenza, la tua fattura sì.

Il nostro test: i limiti del GLM locale su una GPU consumer

Prima di valutare l'API, abbiamo spinto l'opzione locale fino al suo limite, sulla nostra macchina di test (RTX 5070 Ti 12 GB + Intel Core Ultra 9 275HX, CachyOS, Ollama). È proprio questo il vantaggio di una famiglia open-weights: la domanda non è «API o niente», ma «a partire da quale punto l'API diventa necessaria». Una risposta basata su misurazioni, con numeri a supporto:

Misura (26/08/2026)Risultato
Modello testato localmenteGLM-4.7-flash (quantizzato q4)
Peso in memoria20 GB — per 12 GB di VRAM: offload 47 % CPU / 53 % GPU
Generazione (attività di programmazione in Python)35 token/s — sorprendentemente scorrevole
Elaborazione del prompt (prefill)5,8 token/s — il vero collo di bottiglia
Caricamento del modello25 s

La misurazione offre un quadro più sfumato di «non ci sta»: anche con metà del modello trasferita alla CPU, il modello genera a 35 token/s — una velocità confortevole per la chat. Ma il elaborazione del prompt non supera i 5,8 token/s: inviare un file di 2.000 token da analizzare richiede già più di cinque minuti di silenzio prima della prima parola. Un assistente di codice passa il tempo a fare esattamente questo — rileggere i tuoi file a ogni iterazione.

Conclusione inequivocabile: su una GPU di fascia consumer da 12 GB, questa famiglia di modelli è inutilizzabile come agente di programmazione locale, non per la generazione ma per il prefill. È proprio questa lacuna che il Coding Plan colma: la stessa famiglia di modelli, servita con un prefill istantaneo, mentre la tua GPU rimane libera. E se hai 24 GB di VRAM o più, rifai il calcolo — il configuratore ti fornisce il calcolo per la tua macchina.

Prezzi

Il Coding Plan è disponibile in diversi livelli (dal piano base per un uso individuale al livello «Max» per un uso intensivo con più agenti). I prezzi rilevati ad agosto 2026 vanno da pochi dollari al mese per il piano base a qualche decina di dollari per i livelli superiori — cioè un ordine di grandezza al di sotto degli abbonamenti equivalenti di Anthropic o OpenAI. Z.ai propone spesso promozioni sul primo mese: verifica il prezzo attuale prima di abbonarti, perché cambia rapidamente.

Punti di forza e riserve

Punti di forza
  • Pesi aperti = nessun lock-in: i tuoi prompt, il tuo workflow e persino il modello rimangono recuperabili in locale
  • Compatibile con gli assistenti di codice esistenti (Claude Code, Cline, Roo Code) senza dover cambiare strumento
  • Prezzo di ingresso molto inferiore rispetto alle API americane equivalenti
  • Azienda solida: Zhipu AI, quotata a Hong Kong, uno dei principali laboratori nel settore dei modelli aperti
Riserve
  • Quote giudicate poco trasparenti da una parte degli abbonati (« 3× Claude » contestato nelle ore di punta) — Trustpilot 2,1/5 su 32 recensioni ad agosto 2026, monitora il tuo consumo durante la prima settimana
  • Assistenza clienti lenta secondo gli stessi riscontri
  • Le tue richieste passano attraverso i server di Z.ai: una soluzione da escludere per il codice soggetto a NDA — questo vale per qualsiasi API, ed è per questo che l'esecuzione in locale rimane il nostro punto di riferimento
Vedi GLM Coding Plan → Link affiliato — commissione versata dalla marca, senza costo aggiuntivo per te

Domande frequenti

È possibile usare GLM gratuitamente?

Sì. I modelli GLM sono pubblicati con pesi aperti: le varianti quantizzate si scaricano e si eseguono gratuitamente con Ollama o LM Studio, a condizione che la tua VRAM sia sufficiente. L'abbonamento riguarda solo l'accesso API alle varianti complete, offerte sull'infrastruttura di Z.ai.

Il GLM Coding Plan funziona con Claude Code?

Sì, è il suo principale punto di forza: l'API espone un protocollo compatibile, basta configurare lo strumento affinché usi l'endpoint di Z.ai. Anche Cline e Roo Code sono supportati. La configurazione richiede pochi minuti.

Le quote annunciate sono affidabili?

È la principale criticità documentata. Una parte degli abbonati segnala un consumo della quota più rapido di quanto annunciato nelle ore di punta, e la valutazione del servizio su Trustpilot ne risente (2,1/5 su un piccolo campione di 32 recensioni). Il nostro consiglio: scegli il piano base, misura una settimana di utilizzo reale, poi decidi.

Dove vanno i miei dati con questo piano?

Le tue richieste vengono elaborate sui server di Z.ai. Per codice proprietario soggetto a un NDA o dati regolamentati, la regola non cambia: rimani su un modello locale — cosa possibile proprio con questa famiglia, poiché i pesi sono aperti.

Che tipo di macchina serve per eseguire GLM localmente?

Le piccole varianti quantizzate si eseguono su GPU da 8 a 12 GB. Le varianti MoE recenti (GLM-4.7-flash: ~20 GB caricato in q4, misurato sulla nostra macchina) richiedono di più — è misurabile nel nostro configuratore, che ti dice esattamente cosa la tua macchina può sopportare.

Le altre recensioni della selezione

HappyScribe4.5/5
Trascrizione e sottotitoli

Trascrizione, sottotitoli e traduzione con IA, con revisione umana opzionale — la società europea meglio valutata della nostra selezione.

Leggi la recensione →
Creao AI3.5/5
Agenti IA

Trasformare una conversazione in un agente riutilizzabile, collegato ai tuoi strumenti — senza scrivere codice.

Leggi la recensione →
Code Labs Academy3.5/5
Formazione

Bootcamp online — data science & IA, cybersecurity, UX e sviluppo web — con accreditamento di qualità tedesco.

Leggi la recensione →

Trasparenza. Il link «Vedi GLM Coding Plan» è un link affiliato (piattaforma Impact.com). In caso di abbonamento, QualeLLM riceve una commissione versata dal marchio, senza costi aggiuntivi per te. Questa commissione non influenza né il voto né il contenuto: l'alternativa locale gratuita è citata prima del link d'acquisto e le riserve emerse dalle recensioni dei clienti sono pubblicate tali e quali. Metodologia completa · Note legali.