LLM cinesi in locale: Qwen, DeepSeek, GLM, Kimi
Nel 2026, se scarichi un LLM open-weight per eseguirlo a casa tua, è molto probabile che provenga dalla Cina. Qwen, DeepSeek, GLM, Kimi: queste famiglie occupano i primi posti nelle classifiche dei modelli aperti, spesso con licenze più permissive rispetto a quelle dei laboratori occidentali. Questa panoramica fa chiarezza: quanto vale ogni famiglia, cosa dicono davvero le rispettive licenze e perché eseguire un LLM cinese in locale risponde già alla questione della riservatezza.
#Perché gli LLM cinesi dominano il settore open-weight
Il panorama dei modelli aperti è cambiato radicalmente. Mentre due anni fa Meta (Llama) era in testa, oggi sono i laboratori cinesi a pubblicare i pesi più performanti e con maggiore frequenza. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) e Moonshot (Kimi) rilasciano modelli a ritmo sostenuto, dal piccolo 3B ai MoE con diverse centinaia di miliardi di parametri.
Il motivo è tanto strategico quanto tecnico: pubblicare i pesi in modalità open-weight permette loro di ottenere visibilità mondiale, attirare la comunità e affermarsi come standard di fatto, anche rispetto ai modelli chiusi americani. Per te, che esegui i modelli in locale, il risultato è semplice: una scelta enorme di modelli gratuiti, regolarmente aggiornati e spesso alla pari con il cloud nella programmazione, nel ragionamento e nelle capacità multilingue.
#L'esecuzione in locale risolve la questione della privacy
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
È l'obiezione istintiva: «un LLM cinese, i miei dati finiscono in Cina». È vero per le API cloud (chat.qwen.ai, l'app DeepSeek, la piattaforma Zhipu): lì i tuoi prompt transitano effettivamente attraverso server remoti soggetti al diritto cinese. Ma questa guida parla di esecuzione in locale, e in locale questo timore non ha semplicemente più ragione d'essere.
Quando avvii il modello con Ollama o LM Studio, scarichi un file di pesi fissi (ad esempio un GGUF) ed è la tua GPU a calcolare le risposte. Il modello non ha alcuna capacità di comunicare in rete: non è un software che «chiama casa», è una grande matrice di numeri. Nulla esce dalla tua macchina, qualunque sia l'origine del modello.
- In cloud (API)
- I tuoi prompt vengono inviati al fornitore. L'origine del modello e la giurisdizione contano davvero.
- In locale
- I pesi girano sul tuo hardware, offline se lo desideri. Nessun dato lascia il computer.
- Il vero rischio residuo
- Un bias o una censura nelle risposte del modello (su alcuni argomenti sensibili), non una fuga di dati. È una questione di qualità dell'output, non di privacy.
#Le licenze reali: Apache 2.0 e MIT
Un altro luogo comune: «le licenze cinesi sono opache o piene di insidie». La realtà del 2026 è l'opposto: spesso sono le licenze più chiare del mercato. La maggior parte dei modelli di questa panoramica è pubblicata sotto licenza Apache 2.0 o MIT, due licenze permissive internazionali, anche per uso commerciale.
- Qwen
- La maggior parte delle varianti recenti (tra cui Qwen3.8-27B) è rilasciata con licenza Apache 2.0 — uso commerciale libero, redistribuzione autorizzata.
- DeepSeek
- I modelli V3/V4 e R1 sono pubblicati sotto licenza MIT, una delle più permissive.
- GLM (Zhipu)
- Le ultime generazioni, tra cui GLM-5.2, sono passate alla licenza MIT.
- Kimi (Moonshot)
- Pesi aperti con licenza permissiva di tipo MIT/Apache a seconda della versione.
#Qwen (Alibaba): il coltellino svizzero
Qwen è la famiglia più completa e versatile dell'ecosistema. Alibaba propone il modello in tutte le dimensioni, dal 3B che trova posto su una GPU di fascia bassa ai grandi MoE, e in tutte le specializzazioni: generalista, codice (Qwen3-Coder), visione (Qwen3-VL) e una modalità « thinking » per il ragionamento.
- Punti di forza
- Multilingue eccellente (incluso un francese molto corretto), gamma di dimensioni senza pari, ecosistema di strumenti maturato, disponibilità day-0 su Ollama.
- Dimensioni tipiche
- Dai 3B/7B per fare prove, passando per il 27B (Qwen3.8) come punto di equilibrio ottimale tra qualità e VRAM, fino ai MoE 35B-A3B per GPU di grande capacità.
- Per chi
- La prima scelta predefinita se sei alle prime armi e vuoi un modello che faccia tutto correttamente.
#DeepSeek: il campione del ragionamento
DeepSeek si è fatto conoscere con R1, un modello di ragionamento a catena di pensiero che ha sconvolto il settore all'inizio del 2025. La famiglia rimane il punto di riferimento per le attività logiche, matematiche e di programmazione complessa. Le versioni distillate di R1 (7B, 14B, 32B) rendono questo ragionamento accessibile su hardware di uso comune.
- Punti di forza
- Ragionamento e matematica di altissimo livello, licenza MIT, versioni distillate utilizzabili in locale.
- Il tranello
- I modelli di punta (V3/V4, 671B e oltre in MoE) sono enormi: fuori dalla portata di una singola GPU. Per l'uso locale da parte del grande pubblico, punta ai modelli distillati R1.
- Per chi
- Chi affronta problemi complessi di programmazione, matematica o logica, oppure vuole vedere il modello «pensare» prima di rispondere.
#GLM (Zhipu): l'outsider polivalente
GLM, sviluppato da Zhipu AI, è un vero concorrente di Qwen. Buono in francese, solido nella programmazione e nel ragionamento, propone dimensioni ragionevoli (intorno a 9B e 32B) che mirano direttamente alla fascia ottimale delle GPU da 12 a 24 GB, nonché grandi modelli MoE come GLM-5.2 (753B) per configurazioni estreme.
- Punti di forza
- Eccellente equilibrio qualità/dimensioni nelle varianti 9B-32B, buon francese, licenza MIT nelle ultime generazioni.
- Dimensioni tipiche
- 9B per una GPU da 8–12 GB, 32B per 24 GB. Le versioni MoE di frontiera restano riservate ai Mac con grandi quantità di RAM unificata.
- Per chi
- Un'alternativa credibile a Qwen quando vuoi fare un confronto, oppure un modello che funziona bene in francese su hardware modesto.
#Kimi e MiniCPM: i due estremi
Queste due famiglie illustrano i limiti dello spettro. Kimi (Moonshot) punta al molto grande: MoE da 1 trilione di parametri e oltre, noti per il loro lungo contesto e la loro qualità agentica. MiniCPM (team OpenBMB / ModelBest) punta all'opposto: modelli compatti ed efficienti, pensati per girare su mobile o su GPU minuscole.
- Kimi K2 / K3
- MoE giganti (da 1T a 2,8T parametri). Pesi aperti, ma «aperto» non significa «eseguibile sul tuo computer»: servono decine di acceleratori. Riservati ai server, non alle workstation.
- MiniCPM
- Modelli estremamente compatti, alcuni multimodali, progettati per dispositivi embedded e configurazioni modeste. Ideali quando ogni gigabyte di VRAM conta.
- Da ricordare
- I modelli open-weight coprono l'intero spettro hardware. Non confondere «il modello è libero» con «la mia macchina può eseguirlo».
#Quale scegliere in base alla tua VRAM
Il vero fattore limitante in locale non è la marca del modello, ma la VRAM della tua GPU. Con la quantizzazione Q4_K_M (il miglior compromesso tra qualità e dimensioni), ecco alcuni riferimenti concreti per classificare queste famiglie per fascia hardware.
- 8 GB (RTX 3060 8G, 4060)
- Qwen 7B, GLM 9B, DeepSeek-R1 distillato 7B in Q4 (~5 GB). Adatto a un uso agevole della chat e ad attività di programmazione leggere.
- 12 GB (RTX 3060 12G, 4070)
- Il punto ottimale. Qwen 14B, GLM 9B in Q8, DeepSeek-R1 14B (~9 GB). Spazio per un contesto più ampio.
- 16 GB (RTX 4080, 5070 Ti)
- Qwen ~24-27B, DeepSeek-R1 32B con quantizzazione spinta. La fascia «seria» per il ragionamento.
- 24 GB (RTX 3090/4090)
- Qwen 27-32B e GLM 32B interamente in VRAM (~19 GB), MoE 35B-A3B. Il meglio dell'IA locale per il grande pubblico.
- Mac con RAM unificata (48-128+ GB)
- Unico ambiente realistico per i grandi MoE (GLM-5.2, DeepSeek Flash) attraverso offload sulla memoria unificata — con velocità moderata.
#Installare un modello cinese in pratica
Lo stack tipico è identico qualunque sia l'origine del modello: Ollama come daemon di inferenza (ascolta su http://localhost:11434), con Open WebUI o LM Studio come interfaccia. Ecco come recuperare un modello di ogni famiglia.
- 01Installare OllamaScarica il daemon da ollama.com e avvialo. Espone un'API locale sulla porta 11434: non c'è altro da configurare per iniziare.
- 02Scegliere un modello in base alla tua VRAMConsulta di nuovo la tabella qui sopra. In caso di dubbio, scegli Qwen 14B o GLM 9B in Q4_K_M: entrano nella memoria della maggior parte delle GPU recenti e coprono il 90% degli usi.
- 03Scaricare e avviareUn solo comando scarica i pesi e poi apre la chat. Il primo avvio scarica diversi gigabyte; quelli successivi sono istantanei.
- 04Verificare la modalità offlineAppena i pesi sono in cache, disconnetti la rete e continua a parlare: è la prova che il modello funziona al 100% in locale.
#Per approfondire
Questa panoramica ti offre una mappa; queste guide approfondiscono ogni famiglia e le impostazioni per l'esecuzione in locale:
- Lo sweet spot di Qwen
- « Qwen 3.8 27B in locale: installazione Ollama, VRAM e impostazioni » descrive in dettaglio il comando esatto, la VRAM per ciascuna quantizzazione e la modalità thinking.
- Il ragionamento DeepSeek
- «Installare DeepSeek R1 con Ollama» tratta le versioni distillate 7B/14B/32B e la catena di pensiero in locale.
- Scegliere in base alla tua scheda grafica
- Le guide «Quale LLM per 12 GB / 16 GB / 24 GB di VRAM?» traducono questi livelli in raccomandazioni concrete per GPU.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.