Intermedio 11 minNotizie

Kimi K3 a casa: la verità sull’hardware necessario (2.8T parametri)

Risposta diretta

Kimi K3 non gira su un computer desktop: i pesi nativi occupano 1,56 TB e la più piccola quantizzazione GGUF pubblicata (Unsloth, 1 bit dinamico) occupa ancora 594 GB, con 610 GB di memoria consigliati. Né un Mac Studio da 512 GB né una singola RTX 5090 sono sufficienti. Per provarlo, usa l'API di Moonshot oppure kimi-k3:cloud su Ollama; in locale, punta su un modello più piccolo.

I pesi di Kimi K3 sono aperti da fine luglio 2026, e le ricerche « ollama kimi k3 », « kimi k3 lmstudio » o « kimi k3 on 5090 » mostrano che molti lettori si chiedono se possono installarlo a casa propria. Questa guida fornisce i dati pubblicati da Moonshot e da Unsloth, calcola ciò che la tua macchina può caricare e indica cosa fare in alternativa.

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux

#Kimi K3 in locale: ciò che Moonshot ha veramente pubblicato

La scheda Hugging Face di Moonshot descrive Kimi K3 come un modello multimodale a pesi aperti da 2800 miliardi di parametri, con una finestra di contesto di un milione di token. È un Mixture-of-Experts: 896 esperti, di cui 16 sono selezionati per ogni token, per 104 miliardi di parametri attivati. I pesi sono distribuiti in MXFP4 (pesi) con attivazioni MXFP8, con un addestramento che tiene conto della quantizzazione applicato fin dalla fase di fine-tuning supervisionato. Il codice e i pesi rientrano nella « Kimi K3 License »: leggi questo testo prima di qualsiasi uso commerciale, perché non è una licenza MIT o Apache standard. Il modello è arrivato su Hugging Face intorno al 27 luglio 2026 secondo la stampa specializzata.

Parametri totali / attivi
2,8 T in totale, 104 Md attivi per token (foglio Moonshot).
Esperti
896 esperti, 16 selezionati per token, più 2 esperti condivisi.
Formato pubblicato
MXFP4 per i pesi, MXFP8 per le attivazioni. Non è un GGUF.
Contesto
1.048.576 token, con una cache KV che si aggiunge alla memoria dei pesi.
Motori raccomandati
vLLM, SGLang e TokenSpeed. llama.cpp passa attraverso i GGUF della comunità.
i
Attivi non vuol dire residenti
Solo 104 miliardi di parametri lavorano per ogni token, ma il router può scegliere qualsiasi esperto: tutti i pesi devono quindi rimanere accessibili. È la memoria, non la potenza di calcolo, a determinare l'hardware. Il principio è spiegato in dettaglio nella nostra guida sui MoE.

#Quanto pesano veramente i pesi

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Circolano due cifre, e bisogna distinguerle. Alcuni articoli stimano «nell'ordine di 1,4 TB» moltiplicando 2,8 T di parametri per mezzo byte. La dimensione misurata dei file è maggiore: Unsloth e Runpod indicano 1,56 TB per la versione nativa, perché gli strati esterni agli esperti (attenzione, router, esperti condivisi) mantengono una precisione superiore. Il BF16 non quantizzato raggiungerebbe circa 5,6 TB, secondo Runpod. La versione di questa guida che indicava 1,4 TB sottostimava quindi il valore di circa il 10%.

Dimensioni pubblicate per Kimi K3 (fonti: Unsloth, Runpod)
FormatoDimensioneMemoria totale consigliataFideltà misurata
Nativo MXFP4 / UD-Q8_K_XL1,56 TB1,6 TBSenza perdita
Unsloth UD-Q2_K_XL (quantizzazione dinamica a 2 bit)861,3 GB880 GBCirca il 90% di concordanza top-1
Unsloth UD-IQ2_XXS711,1 GB726 GB84,1 % di accordo top-1
Unsloth UD-IQ1_M648,9 GB665 GB81,2 % di accordo top-1
Unsloth UD-IQ1_S (1 bit dinamico)594 GB610 GB78,9 % di accordo top-1
BF16 (teorico)circa 5,6 TBFuori portataRiferimento

La tabella confuta un luogo comune della versione precedente: un Q2 non è «sempre dell'ordine del terabyte». Unsloth offre effettivamente GGUF sotto i 900 GB. Ma 594 GB restano quasi quindici volte la memoria di una RTX 5090 da 32 GB, e la differenza di qualità è reale: la quantizzazione dinamica a 1 bit riproduce la scelta del modello originale solo nel 78,9 % dei casi sul set di misurazione di Unsloth. Per capire come i bit influiscono sulla qualità, consulta la nostra guida sulla quantizzazione.

#L'hardware: cosa è consigliato, cosa è possibile

Moonshot non pubblica una configurazione minima sulla scheda del modello: rimanda alle ricette vLLM, SGLang e TokenSpeed e alla propria API. Il riferimento documentato per il self-hosting nativo proviene da Runpod: un nodo con otto GPU B300 da 288 GB ciascuna, pari a circa 2,3 TB, oppure sedici B200 distribuite su due nodi. Il dato «64 acceleratori o più» che questa pagina riportava non compare in nessuna fonte primaria consultata: viene rimosso.

Con un GGUF Unsloth, la regola indicata nella loro documentazione è semplice: la somma di RAM e VRAM deve essere approssimativamente uguale alla dimensione della quantizzazione, altrimenti il modello funziona ma passa su disco, molto più lentamente. Unsloth cita anche circa 20 token al secondo in generazione quando il modello entra nella memoria delle B200. È una velocità di elaborazione riportata da un fornitore su hardware da datacenter, non una misura applicabile a un computer domestico.

#E su un Mac? Il calcolo anziché le voci

Per il dato di «16 secondi per token su un MacBook Pro M1 Max» riportato in questa pagina non è stata trovata alcuna fonte verificabile: non lo riproponiamo come un fatto. Ciò che le fonti stabiliscono è più chiaro. Kingy AI osserva che il punto di partenza (checkpoint da 1,56 TB) superava già la capacità di un Mac Studio da 512 GB e che anche il file da 553,2 GiB della versione a 1 bit supera la capacità di questa macchina prima ancora di considerare l'overhead. Un Mac da 128 GB ha circa un quinto dei 610 GB consigliati.

Puoi invece stimare autonomamente l'ordine di grandezza. Se la memoria non è sufficiente, ogni token rilegge dall'SSD gli esperti che attiva: 104 miliardi di parametri a circa 4 bit, pari a circa 50 GB letti per token. Con un SSD che fornisce 3 GB/s, si ottengono circa 17 secondi per token; a 7 GB/s, circa 7 secondi. È un calcolo teorico del limite massimo, non una misurazione, ma spiega perché le testimonianze sull'esecuzione «su disco» riportano tempi in secondi per token e non in token al secondo.

!
Cosa significa "funziona"
A 10 secondi per token, una risposta di 300 token richiede quasi cinquanta minuti, e la modalità di ragionamento di K3, sempre attiva, aggiunge ulteriori token di riflessione prima della risposta. Tecnicamente caricato, praticamente inutilizzabile.

#Ollama, LM Studio, llama.cpp: cosa permette ogni strumento

Ollama
La libreria ufficiale elenca una sola variante, kimi-k3:cloud: il modello viene eseguito sui server di Ollama, non sulla tua macchina. Il comando ollama run kimi-k3:cloud serve a provare il modello con l'interfaccia abituale, con i limiti di riservatezza e di fatturazione di un servizio remoto.
LM Studio
Carica GGUF locali. Per K3, ciò implica scaricare diverse centinaia di GB di file Unsloth e disporre della memoria corrispondente. Su una macchina di fascia consumer, la risposta è no.
llama.cpp
È il motore a cui sono destinati i GGUF Unsloth, che si basano su un ramo derivato di llama.cpp con supporto alla visione. Gestisce l'offload degli esperti sulla CPU e i file suddivisi in più parti: è la strada realistica per una workstation con diverse centinaia di GB di RAM.
vLLM e SGLang
I due motori raccomandati da Moonshot per un servizio multi-GPU con il formato nativo.
La tua macchina di fronte a Kimi K3
MacchinaMemoria disponibileVerdetto
RTX 5090 (32 GB) + 64 GB di RAMcirca 96 GBImpossibile: 6 volte troppo poco, anche con 1 bit
Mac mini o MacBook, da 16 a 64 GBDa 16 a 64 GBImpossibile in locale; API o cloud soltanto
Mac Studio da 128 a 256 GBDa 128 a 256 GBInsufficiente per i 610 GB consigliati
Mac Studio 512 GB512 GBInferiore alla dimensione del file a 1 bit, senza ancora contare il contesto
Workstation con da 768 GB a 1 TB di RAM + GPUDa 600 a 900 GBFattibile in GGUF da 1 a 2 bit, velocità modesta
8 GPU B300 (circa 2,3 TB)2,3 TBConfigurazione documentata per il formato nativo

#Le opzioni realistiche per provare Kimi K3

  1. 01
    1. L'API ufficiale di Moonshot
    Il modello si chiama kimi-k3 su platform.kimi.ai, con un'API compatibile con OpenAI e Anthropic. È il modo più veloce per valutare la qualità, con un parametro reasoning_effort regolabile su low, high o max.
  2. 02
    2. Ollama cloud
    ollama run kimi-k3:cloud utilise vos habitudes Ollama avec l'inférence déportée. La page de la bibliothèque affiche les tarifs par million de tokens : vérifiez-les avant d'automatiser. Notre guide sur Ollama Cloud détaille les limites.
  3. 03
    3. Noleggio di GPU
    Noleggiare un nodo multi-GPU con tariffazione oraria per la durata di un test, con vLLM. Fai prima il calcolo della convenienza economica (costo orario diviso per i token al secondo mantenuti stabilmente), che Runpod illustra nella sua FAQ.
  4. 04
    4. Una workstation con molta RAM
    Solo se hai già 700 GB di memoria: GGUF UD-IQ1_S e llama.cpp, accettando una qualità ridotta e un throughput basso.

#Avere pesi aperti non significa poter eseguire il modello a casa

I pesi aperti garantiscono il diritto di scaricarli, sottoporli ad audit, perfezionarli e, a seconda della licenza, redistribuirli. Non garantiscono che qualcuno possa eseguirli. Un modello da 30 miliardi di parametri su una scheda da 24 GB ti appartiene realmente; un modello da 2,8 T che solo un cluster può caricare rimane, in pratica, un servizio. Kimi K3 è una buona notizia per la possibilità di effettuare audit e per le organizzazioni che dispongono già di un cluster, senza cambiare ciò che un privato può fare a casa propria.

#Alternative che il tuo hardware può realmente caricare

Il catalogo QuelLLM stima i requisiti di memoria in Q4, escluso il contesto: DeepSeek V4 Flash 284B circa 170 GB, GLM 5.2 753B-A40B circa 437 GB, Kimi K3 circa 1 624 GB. Per un uso quotidiano, un modello da 30 a 70 miliardi in Q4 continua a offrire il miglior rapporto tra qualità e fattibilità.

DeepSeek V4 Flash 284B
Circa 170 GB in Q4 secondo il catalogo: possibile su un Mac Studio con molta memoria o su una workstation. Vedi la guida dedicata.
GLM 5.2 753B-A40B
Circa 437 GB in Q4: è la dimensione più vicina a K3 accessibile a una workstation ben equipaggiata.
Kimi K2.5 e K2.7
Circa 600 GB in Q4: più piccoli di K3, ma richiedono comunque un'infrastruttura da workstation.
Modelli da 30 a 70 miliardi
Su una scheda da 24 a 32 GB o su un Mac da 64 GB: scelta ragionevole per un uso reale. Il calcolatore della VRAM fornisce il valore esatto.

#Verdetto: Kimi K3 in locale, quasi mai

Pesi nativi per 1,56 TB, quantizzazioni da 594 a 861 GB, 610 GB di memoria per la più piccola: Kimi K3 è un modello per server. Per valutarlo, usa l'API o kimi-k3:cloud. Per un uso concreto a casa tua, scegli un modello che rientri nella memoria disponibile con un margine per il contesto.

FAQ
È possibile installare Kimi K3 con Ollama?+
Non in locale. La libreria Ollama offre solo la variante kimi-k3:cloud, che viene eseguita su server remoti e non sulla tua macchina. Per un modello realmente caricato sul tuo dispositivo, servirebbe un GGUF di diverse centinaia di GB tramite llama.cpp, il che esclude un normale computer, anche se molto ben equipaggiato.
Kimi K3 funziona su una RTX 5090?+
No. Una RTX 5090 offre 32 GB di VRAM, mentre il più piccolo GGUF Unsloth pesa 594 GB e richiede 610 GB di memoria totale. Anche con l'aggiunta di 128 GB di RAM di sistema, la macchina resterebbe ben lontana dalla memoria necessaria e l'offload su disco renderebbe la generazione inutilizzabile.
Un Mac mini o un Mac Studio può eseguire Kimi K3?+
In pratica, no. Un Mac Studio da 512 GB ha meno memoria di quanta ne richieda il file a 1 bit (553,2 GiB), ancora prima di considerare il contesto, e un Mac mini è ancora molto più lontano da questa soglia. Su queste macchine, scegli un modello più piccolo oppure usa l'API del modello o Ollama cloud.
LM Studio può caricare Kimi K3?+
In teoria sì: LM Studio legge i file GGUF e Unsloth ne pubblica in questo formato. In pratica serve memoria sufficiente: almeno 610 GB per la versione a 1 bit. Su un computer comune l’applicazione non può caricare il modello; è meglio sceglierne uno più piccolo.
Quale quantizzazione scegliere per Kimi K3?+
Unsloth raccomanda UD-IQ1_S (594 GB) come equilibrio tra dimensioni e qualità: 78,9% di concordanza top-1 con l'originale secondo le sue misurazioni. La variante a 2 bit UD-Q2_K_XL, da 861 GB, sale a circa il 90%. In entrambi i casi, questo presuppone già una workstation con più di 600 GB di memoria.
Perché Kimi K3 è così grande con soli 104 miliardi di parametri attivi?+
Perché il router può attivare uno qualsiasi dei 896 esperti: solo 16 eseguono i calcoli per ogni token, ma tutti devono restare disponibili in memoria. Il costo di calcolo per token è moderato; è la capacità di memoria, non la potenza, a rendere necessario hardware da server.

#Per approfondire

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.