Kimi K3 a casa: la verità sull’hardware necessario (2.8T parametri)
Kimi K3 non gira su un computer desktop: i pesi nativi occupano 1,56 TB e la più piccola quantizzazione GGUF pubblicata (Unsloth, 1 bit dinamico) occupa ancora 594 GB, con 610 GB di memoria consigliati. Né un Mac Studio da 512 GB né una singola RTX 5090 sono sufficienti. Per provarlo, usa l'API di Moonshot oppure kimi-k3:cloud su Ollama; in locale, punta su un modello più piccolo.
I pesi di Kimi K3 sono aperti da fine luglio 2026, e le ricerche « ollama kimi k3 », « kimi k3 lmstudio » o « kimi k3 on 5090 » mostrano che molti lettori si chiedono se possono installarlo a casa propria. Questa guida fornisce i dati pubblicati da Moonshot e da Unsloth, calcola ciò che la tua macchina può caricare e indica cosa fare in alternativa.
#Kimi K3 in locale: ciò che Moonshot ha veramente pubblicato
La scheda Hugging Face di Moonshot descrive Kimi K3 come un modello multimodale a pesi aperti da 2800 miliardi di parametri, con una finestra di contesto di un milione di token. È un Mixture-of-Experts: 896 esperti, di cui 16 sono selezionati per ogni token, per 104 miliardi di parametri attivati. I pesi sono distribuiti in MXFP4 (pesi) con attivazioni MXFP8, con un addestramento che tiene conto della quantizzazione applicato fin dalla fase di fine-tuning supervisionato. Il codice e i pesi rientrano nella « Kimi K3 License »: leggi questo testo prima di qualsiasi uso commerciale, perché non è una licenza MIT o Apache standard. Il modello è arrivato su Hugging Face intorno al 27 luglio 2026 secondo la stampa specializzata.
- Parametri totali / attivi
- 2,8 T in totale, 104 Md attivi per token (foglio Moonshot).
- Esperti
- 896 esperti, 16 selezionati per token, più 2 esperti condivisi.
- Formato pubblicato
- MXFP4 per i pesi, MXFP8 per le attivazioni. Non è un GGUF.
- Contesto
- 1.048.576 token, con una cache KV che si aggiunge alla memoria dei pesi.
- Motori raccomandati
- vLLM, SGLang e TokenSpeed. llama.cpp passa attraverso i GGUF della comunità.
#Quanto pesano veramente i pesi
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Circolano due cifre, e bisogna distinguerle. Alcuni articoli stimano «nell'ordine di 1,4 TB» moltiplicando 2,8 T di parametri per mezzo byte. La dimensione misurata dei file è maggiore: Unsloth e Runpod indicano 1,56 TB per la versione nativa, perché gli strati esterni agli esperti (attenzione, router, esperti condivisi) mantengono una precisione superiore. Il BF16 non quantizzato raggiungerebbe circa 5,6 TB, secondo Runpod. La versione di questa guida che indicava 1,4 TB sottostimava quindi il valore di circa il 10%.
| Formato | Dimensione | Memoria totale consigliata | Fideltà misurata |
|---|---|---|---|
| Nativo MXFP4 / UD-Q8_K_XL | 1,56 TB | 1,6 TB | Senza perdita |
| Unsloth UD-Q2_K_XL (quantizzazione dinamica a 2 bit) | 861,3 GB | 880 GB | Circa il 90% di concordanza top-1 |
| Unsloth UD-IQ2_XXS | 711,1 GB | 726 GB | 84,1 % di accordo top-1 |
| Unsloth UD-IQ1_M | 648,9 GB | 665 GB | 81,2 % di accordo top-1 |
| Unsloth UD-IQ1_S (1 bit dinamico) | 594 GB | 610 GB | 78,9 % di accordo top-1 |
| BF16 (teorico) | circa 5,6 TB | Fuori portata | Riferimento |
La tabella confuta un luogo comune della versione precedente: un Q2 non è «sempre dell'ordine del terabyte». Unsloth offre effettivamente GGUF sotto i 900 GB. Ma 594 GB restano quasi quindici volte la memoria di una RTX 5090 da 32 GB, e la differenza di qualità è reale: la quantizzazione dinamica a 1 bit riproduce la scelta del modello originale solo nel 78,9 % dei casi sul set di misurazione di Unsloth. Per capire come i bit influiscono sulla qualità, consulta la nostra guida sulla quantizzazione.
#L'hardware: cosa è consigliato, cosa è possibile
Moonshot non pubblica una configurazione minima sulla scheda del modello: rimanda alle ricette vLLM, SGLang e TokenSpeed e alla propria API. Il riferimento documentato per il self-hosting nativo proviene da Runpod: un nodo con otto GPU B300 da 288 GB ciascuna, pari a circa 2,3 TB, oppure sedici B200 distribuite su due nodi. Il dato «64 acceleratori o più» che questa pagina riportava non compare in nessuna fonte primaria consultata: viene rimosso.
Con un GGUF Unsloth, la regola indicata nella loro documentazione è semplice: la somma di RAM e VRAM deve essere approssimativamente uguale alla dimensione della quantizzazione, altrimenti il modello funziona ma passa su disco, molto più lentamente. Unsloth cita anche circa 20 token al secondo in generazione quando il modello entra nella memoria delle B200. È una velocità di elaborazione riportata da un fornitore su hardware da datacenter, non una misura applicabile a un computer domestico.
#E su un Mac? Il calcolo anziché le voci
Per il dato di «16 secondi per token su un MacBook Pro M1 Max» riportato in questa pagina non è stata trovata alcuna fonte verificabile: non lo riproponiamo come un fatto. Ciò che le fonti stabiliscono è più chiaro. Kingy AI osserva che il punto di partenza (checkpoint da 1,56 TB) superava già la capacità di un Mac Studio da 512 GB e che anche il file da 553,2 GiB della versione a 1 bit supera la capacità di questa macchina prima ancora di considerare l'overhead. Un Mac da 128 GB ha circa un quinto dei 610 GB consigliati.
Puoi invece stimare autonomamente l'ordine di grandezza. Se la memoria non è sufficiente, ogni token rilegge dall'SSD gli esperti che attiva: 104 miliardi di parametri a circa 4 bit, pari a circa 50 GB letti per token. Con un SSD che fornisce 3 GB/s, si ottengono circa 17 secondi per token; a 7 GB/s, circa 7 secondi. È un calcolo teorico del limite massimo, non una misurazione, ma spiega perché le testimonianze sull'esecuzione «su disco» riportano tempi in secondi per token e non in token al secondo.
#Ollama, LM Studio, llama.cpp: cosa permette ogni strumento
- Ollama
- La libreria ufficiale elenca una sola variante, kimi-k3:cloud: il modello viene eseguito sui server di Ollama, non sulla tua macchina. Il comando ollama run kimi-k3:cloud serve a provare il modello con l'interfaccia abituale, con i limiti di riservatezza e di fatturazione di un servizio remoto.
- LM Studio
- Carica GGUF locali. Per K3, ciò implica scaricare diverse centinaia di GB di file Unsloth e disporre della memoria corrispondente. Su una macchina di fascia consumer, la risposta è no.
- llama.cpp
- È il motore a cui sono destinati i GGUF Unsloth, che si basano su un ramo derivato di llama.cpp con supporto alla visione. Gestisce l'offload degli esperti sulla CPU e i file suddivisi in più parti: è la strada realistica per una workstation con diverse centinaia di GB di RAM.
- vLLM e SGLang
- I due motori raccomandati da Moonshot per un servizio multi-GPU con il formato nativo.
| Macchina | Memoria disponibile | Verdetto |
|---|---|---|
| RTX 5090 (32 GB) + 64 GB di RAM | circa 96 GB | Impossibile: 6 volte troppo poco, anche con 1 bit |
| Mac mini o MacBook, da 16 a 64 GB | Da 16 a 64 GB | Impossibile in locale; API o cloud soltanto |
| Mac Studio da 128 a 256 GB | Da 128 a 256 GB | Insufficiente per i 610 GB consigliati |
| Mac Studio 512 GB | 512 GB | Inferiore alla dimensione del file a 1 bit, senza ancora contare il contesto |
| Workstation con da 768 GB a 1 TB di RAM + GPU | Da 600 a 900 GB | Fattibile in GGUF da 1 a 2 bit, velocità modesta |
| 8 GPU B300 (circa 2,3 TB) | 2,3 TB | Configurazione documentata per il formato nativo |
#Le opzioni realistiche per provare Kimi K3
- 011. L'API ufficiale di MoonshotIl modello si chiama kimi-k3 su platform.kimi.ai, con un'API compatibile con OpenAI e Anthropic. È il modo più veloce per valutare la qualità, con un parametro reasoning_effort regolabile su low, high o max.
- 022. Ollama cloudollama run kimi-k3:cloud utilise vos habitudes Ollama avec l'inférence déportée. La page de la bibliothèque affiche les tarifs par million de tokens : vérifiez-les avant d'automatiser. Notre guide sur Ollama Cloud détaille les limites.
- 033. Noleggio di GPUNoleggiare un nodo multi-GPU con tariffazione oraria per la durata di un test, con vLLM. Fai prima il calcolo della convenienza economica (costo orario diviso per i token al secondo mantenuti stabilmente), che Runpod illustra nella sua FAQ.
- 044. Una workstation con molta RAMSolo se hai già 700 GB di memoria: GGUF UD-IQ1_S e llama.cpp, accettando una qualità ridotta e un throughput basso.
#Avere pesi aperti non significa poter eseguire il modello a casa
I pesi aperti garantiscono il diritto di scaricarli, sottoporli ad audit, perfezionarli e, a seconda della licenza, redistribuirli. Non garantiscono che qualcuno possa eseguirli. Un modello da 30 miliardi di parametri su una scheda da 24 GB ti appartiene realmente; un modello da 2,8 T che solo un cluster può caricare rimane, in pratica, un servizio. Kimi K3 è una buona notizia per la possibilità di effettuare audit e per le organizzazioni che dispongono già di un cluster, senza cambiare ciò che un privato può fare a casa propria.
#Alternative che il tuo hardware può realmente caricare
Il catalogo QuelLLM stima i requisiti di memoria in Q4, escluso il contesto: DeepSeek V4 Flash 284B circa 170 GB, GLM 5.2 753B-A40B circa 437 GB, Kimi K3 circa 1 624 GB. Per un uso quotidiano, un modello da 30 a 70 miliardi in Q4 continua a offrire il miglior rapporto tra qualità e fattibilità.
- DeepSeek V4 Flash 284B
- Circa 170 GB in Q4 secondo il catalogo: possibile su un Mac Studio con molta memoria o su una workstation. Vedi la guida dedicata.
- GLM 5.2 753B-A40B
- Circa 437 GB in Q4: è la dimensione più vicina a K3 accessibile a una workstation ben equipaggiata.
- Kimi K2.5 e K2.7
- Circa 600 GB in Q4: più piccoli di K3, ma richiedono comunque un'infrastruttura da workstation.
- Modelli da 30 a 70 miliardi
- Su una scheda da 24 a 32 GB o su un Mac da 64 GB: scelta ragionevole per un uso reale. Il calcolatore della VRAM fornisce il valore esatto.
#Verdetto: Kimi K3 in locale, quasi mai
Pesi nativi per 1,56 TB, quantizzazioni da 594 a 861 GB, 610 GB di memoria per la più piccola: Kimi K3 è un modello per server. Per valutarlo, usa l'API o kimi-k3:cloud. Per un uso concreto a casa tua, scegli un modello che rientri nella memoria disponibile con un margine per il contesto.
È possibile installare Kimi K3 con Ollama?+
Kimi K3 funziona su una RTX 5090?+
Un Mac mini o un Mac Studio può eseguire Kimi K3?+
LM Studio può caricare Kimi K3?+
Quale quantizzazione scegliere per Kimi K3?+
Perché Kimi K3 è così grande con soli 104 miliardi di parametri attivi?+
#Per approfondire
- DeepSeek V4 Flash 284B: il primo modello di frontiera su Mac Studio
- GLM-5.2 in locale: Ollama e LM Studio
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- MoE spiegato: perché un 30B-A3B gira come un modello piccolo
- Ollama Cloud: prezzi, recensioni e limiti
- Calcolatore VRAM
- Fonte: scheda Hugging Face di Kimi K3
- Fonte: Unsloth, Kimi K3 in locale
- Fonte: FAQ tecnica Runpod
- Fonte: libreria Ollama, kimi-k3
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.