Principiante 12 minPanoramica

LLM cinesi in locale: Qwen, DeepSeek, GLM, Kimi

Nel 2026, se scarichi un LLM open-weight per eseguirlo a casa tua, è molto probabile che provenga dalla Cina. Qwen, DeepSeek, GLM, Kimi: queste famiglie occupano i primi posti nelle classifiche dei modelli aperti, spesso con licenze più permissive rispetto a quelle dei laboratori occidentali. Questa panoramica fa chiarezza: quanto vale ogni famiglia, cosa dicono davvero le rispettive licenze e perché eseguire un LLM cinese in locale risponde già alla questione della riservatezza.

Di Mohamed Meguedmi·Agg. 2026-09-01·Testato su Windows, macOS e Linux

#Perché gli LLM cinesi dominano il settore open-weight

Il panorama dei modelli aperti è cambiato radicalmente. Mentre due anni fa Meta (Llama) era in testa, oggi sono i laboratori cinesi a pubblicare i pesi più performanti e con maggiore frequenza. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) e Moonshot (Kimi) rilasciano modelli a ritmo sostenuto, dal piccolo 3B ai MoE con diverse centinaia di miliardi di parametri.

Il motivo è tanto strategico quanto tecnico: pubblicare i pesi in modalità open-weight permette loro di ottenere visibilità mondiale, attirare la comunità e affermarsi come standard di fatto, anche rispetto ai modelli chiusi americani. Per te, che esegui i modelli in locale, il risultato è semplice: una scelta enorme di modelli gratuiti, regolarmente aggiornati e spesso alla pari con il cloud nella programmazione, nel ragionamento e nelle capacità multilingue.

i
Open-weight ≠ open-source
« Open-weight » significa che i pesi del modello sono scaricabili e eseguibili liberamente. Non garantisce che i dati di addestramento o il codice completo siano pubblicati. È il caso della quasi totalità dei modelli di questo manuale — ricevi il modello, non la ricetta.

#L'esecuzione in locale risolve la questione della privacy

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

È l'obiezione istintiva: «un LLM cinese, i miei dati finiscono in Cina». È vero per le API cloud (chat.qwen.ai, l'app DeepSeek, la piattaforma Zhipu): lì i tuoi prompt transitano effettivamente attraverso server remoti soggetti al diritto cinese. Ma questa guida parla di esecuzione in locale, e in locale questo timore non ha semplicemente più ragione d'essere.

Quando avvii il modello con Ollama o LM Studio, scarichi un file di pesi fissi (ad esempio un GGUF) ed è la tua GPU a calcolare le risposte. Il modello non ha alcuna capacità di comunicare in rete: non è un software che «chiama casa», è una grande matrice di numeri. Nulla esce dalla tua macchina, qualunque sia l'origine del modello.

In cloud (API)
I tuoi prompt vengono inviati al fornitore. L'origine del modello e la giurisdizione contano davvero.
In locale
I pesi girano sul tuo hardware, offline se lo desideri. Nessun dato lascia il computer.
Il vero rischio residuo
Un bias o una censura nelle risposte del modello (su alcuni argomenti sensibili), non una fuga di dati. È una questione di qualità dell'output, non di privacy.
→
Verificare che nulla esca
Per convincertene: avvia Ollama, disattiva il Wi-Fi e conversa con il modello. Tutto continua a funzionare. Un LLM locale ha bisogno della rete solo per il download iniziale dei pesi.

#Le licenze reali: Apache 2.0 e MIT

Un altro luogo comune: «le licenze cinesi sono opache o piene di insidie». La realtà del 2026 è l'opposto: spesso sono le licenze più chiare del mercato. La maggior parte dei modelli di questa panoramica è pubblicata sotto licenza Apache 2.0 o MIT, due licenze permissive internazionali, anche per uso commerciale.

Qwen
La maggior parte delle varianti recenti (tra cui Qwen3.8-27B) è rilasciata con licenza Apache 2.0 — uso commerciale libero, redistribuzione autorizzata.
DeepSeek
I modelli V3/V4 e R1 sono pubblicati sotto licenza MIT, una delle più permissive.
GLM (Zhipu)
Le ultime generazioni, tra cui GLM-5.2, sono passate alla licenza MIT.
Kimi (Moonshot)
Pesi aperti con licenza permissiva di tipo MIT/Apache a seconda della versione.
!
Leggi comunque la scheda del modello
Alcune famiglie più datate o varianti specifiche possono avere una licenza propria con clausole d'uso. Prima di un deployment commerciale, verifica sempre il file LICENSE sulla pagina Hugging Face dello specifico modello che scarichi — non basarti soltanto sulla reputazione della famiglia.

#Qwen (Alibaba): il coltellino svizzero

Qwen è la famiglia più completa e versatile dell'ecosistema. Alibaba propone il modello in tutte le dimensioni, dal 3B che trova posto su una GPU di fascia bassa ai grandi MoE, e in tutte le specializzazioni: generalista, codice (Qwen3-Coder), visione (Qwen3-VL) e una modalità « thinking » per il ragionamento.

Punti di forza
Multilingue eccellente (incluso un francese molto corretto), gamma di dimensioni senza pari, ecosistema di strumenti maturato, disponibilità day-0 su Ollama.
Dimensioni tipiche
Dai 3B/7B per fare prove, passando per il 27B (Qwen3.8) come punto di equilibrio ottimale tra qualità e VRAM, fino ai MoE 35B-A3B per GPU di grande capacità.
Per chi
La prima scelta predefinita se sei alle prime armi e vuoi un modello che faccia tutto correttamente.

#DeepSeek: il campione del ragionamento

DeepSeek si è fatto conoscere con R1, un modello di ragionamento a catena di pensiero che ha sconvolto il settore all'inizio del 2025. La famiglia rimane il punto di riferimento per le attività logiche, matematiche e di programmazione complessa. Le versioni distillate di R1 (7B, 14B, 32B) rendono questo ragionamento accessibile su hardware di uso comune.

Punti di forza
Ragionamento e matematica di altissimo livello, licenza MIT, versioni distillate utilizzabili in locale.
Il tranello
I modelli di punta (V3/V4, 671B e oltre in MoE) sono enormi: fuori dalla portata di una singola GPU. Per l'uso locale da parte del grande pubblico, punta ai modelli distillati R1.
Per chi
Chi affronta problemi complessi di programmazione, matematica o logica, oppure vuole vedere il modello «pensare» prima di rispondere.

#GLM (Zhipu): l'outsider polivalente

GLM, sviluppato da Zhipu AI, è un vero concorrente di Qwen. Buono in francese, solido nella programmazione e nel ragionamento, propone dimensioni ragionevoli (intorno a 9B e 32B) che mirano direttamente alla fascia ottimale delle GPU da 12 a 24 GB, nonché grandi modelli MoE come GLM-5.2 (753B) per configurazioni estreme.

Punti di forza
Eccellente equilibrio qualità/dimensioni nelle varianti 9B-32B, buon francese, licenza MIT nelle ultime generazioni.
Dimensioni tipiche
9B per una GPU da 8–12 GB, 32B per 24 GB. Le versioni MoE di frontiera restano riservate ai Mac con grandi quantità di RAM unificata.
Per chi
Un'alternativa credibile a Qwen quando vuoi fare un confronto, oppure un modello che funziona bene in francese su hardware modesto.

#Kimi e MiniCPM: i due estremi

Queste due famiglie illustrano i limiti dello spettro. Kimi (Moonshot) punta al molto grande: MoE da 1 trilione di parametri e oltre, noti per il loro lungo contesto e la loro qualità agentica. MiniCPM (team OpenBMB / ModelBest) punta all'opposto: modelli compatti ed efficienti, pensati per girare su mobile o su GPU minuscole.

Kimi K2 / K3
MoE giganti (da 1T a 2,8T parametri). Pesi aperti, ma «aperto» non significa «eseguibile sul tuo computer»: servono decine di acceleratori. Riservati ai server, non alle workstation.
MiniCPM
Modelli estremamente compatti, alcuni multimodali, progettati per dispositivi embedded e configurazioni modeste. Ideali quando ogni gigabyte di VRAM conta.
Da ricordare
I modelli open-weight coprono l'intero spettro hardware. Non confondere «il modello è libero» con «la mia macchina può eseguirlo».

#Quale scegliere in base alla tua VRAM

Il vero fattore limitante in locale non è la marca del modello, ma la VRAM della tua GPU. Con la quantizzazione Q4_K_M (il miglior compromesso tra qualità e dimensioni), ecco alcuni riferimenti concreti per classificare queste famiglie per fascia hardware.

8 GB (RTX 3060 8G, 4060)
Qwen 7B, GLM 9B, DeepSeek-R1 distillato 7B in Q4 (~5 GB). Adatto a un uso agevole della chat e ad attività di programmazione leggere.
12 GB (RTX 3060 12G, 4070)
Il punto ottimale. Qwen 14B, GLM 9B in Q8, DeepSeek-R1 14B (~9 GB). Spazio per un contesto più ampio.
16 GB (RTX 4080, 5070 Ti)
Qwen ~24-27B, DeepSeek-R1 32B con quantizzazione spinta. La fascia «seria» per il ragionamento.
24 GB (RTX 3090/4090)
Qwen 27-32B e GLM 32B interamente in VRAM (~19 GB), MoE 35B-A3B. Il meglio dell'IA locale per il grande pubblico.
Mac con RAM unificata (48-128+ GB)
Unico ambiente realistico per i grandi MoE (GLM-5.2, DeepSeek Flash) attraverso offload sulla memoria unificata — con velocità moderata.
i
Indicazione della VRAM in Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Aggiungi sempre da 1 a 2 GB per il contesto e il sistema. Un modello che supera la capacità della VRAM passa in RAM (offload CPU) e il suo throughput crolla.

#Installare un modello cinese in pratica

Lo stack tipico è identico qualunque sia l'origine del modello: Ollama come daemon di inferenza (ascolta su http://localhost:11434), con Open WebUI o LM Studio come interfaccia. Ecco come recuperare un modello di ogni famiglia.

  1. 01
    Installare Ollama
    Scarica il daemon da ollama.com e avvialo. Espone un'API locale sulla porta 11434: non c'è altro da configurare per iniziare.
  2. 02
    Scegliere un modello in base alla tua VRAM
    Consulta di nuovo la tabella qui sopra. In caso di dubbio, scegli Qwen 14B o GLM 9B in Q4_K_M: entrano nella memoria della maggior parte delle GPU recenti e coprono il 90% degli usi.
  3. 03
    Scaricare e avviare
    Un solo comando scarica i pesi e poi apre la chat. Il primo avvio scarica diversi gigabyte; quelli successivi sono istantanei.
  4. 04
    Verificare la modalità offline
    Appena i pesi sono in cache, disconnetti la rete e continua a parlare: è la prova che il modello funziona al 100% in locale.
Terminale
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
→
I nomi dei tag variano
I tag esatti (qwen3, deepseek-r1:14b, ecc.) e le versioni disponibili cambiano rapidamente nella libreria di Ollama. Consulta ollama.com/library per conoscere il nome preciso e la dimensione in GB di ogni variante prima di scaricarla.

#Per approfondire

Questa panoramica ti offre una mappa; queste guide approfondiscono ogni famiglia e le impostazioni per l'esecuzione in locale:

Lo sweet spot di Qwen
« Qwen 3.8 27B in locale: installazione Ollama, VRAM e impostazioni » descrive in dettaglio il comando esatto, la VRAM per ciascuna quantizzazione e la modalità thinking.
Il ragionamento DeepSeek
«Installare DeepSeek R1 con Ollama» tratta le versioni distillate 7B/14B/32B e la catena di pensiero in locale.
Scegliere in base alla tua scheda grafica
Le guide «Quale LLM per 12 GB / 16 GB / 24 GB di VRAM?» traducono questi livelli in raccomandazioni concrete per GPU.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.