LLM locale senza GPU (CPU): modelli in base alla RAM 8/16/32 GB
Eseguire un LLM locale senza GPU, usando solo la CPU, è del tutto possibile nel 2026. Con un Ryzen 7 o un i7 recente e 16 GB di RAM, puoi conversare con un modello 3B in tempo quasi reale, oppure lasciare girare un 7B per risposte meno urgenti. Questa guida ti indica quali modelli scegliere in base alla tua RAM, i dati reali misurati su macchine comuni e le impostazioni che fanno davvero la differenza.
Stai scegliendo un computer? Le nostre scelte per budget →
#Perché eseguire un LLM locale senza GPU?
Tutte le guide sull'IA locale partono dal presupposto che tu abbia una RTX 4070 nel tuo PC tower. La realtà è che la stragrande maggioranza dei laptop, dei PC desktop professionali e dei mini-PC utilizza una GPU integrata o non ha alcuna scheda dedicata. Buona notizia: un LLM eseguito solo sulla CPU funziona.
Tre ragioni tipiche per usare solo la CPU: un laptop senza GPU NVIDIA (la maggior parte dei Dell, Lenovo e dei vecchi Mac Intel), un PC desktop professionale con una iGPU Intel o AMD, oppure un server Linux headless che non si vuole dotare di una GPU. In tutti e tre i casi, la questione non è "funziona o no" ma "quale modello rimane utilizzabile".
#Ciò che puoi aspettarti in pratica
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Prima di scaricare qualsiasi cosa, calibra le tue aspettative. Un LLM locale eseguito sulla CPU, senza GPU, non ha la stessa reattività di ChatGPT o di un modello su RTX 4090. Ecco gli ordini di grandezza realistici nel 2026:
- Modello 1B–2B Q4
- Da 20 a 40 token/sec su una CPU recente. Molto fluido, quasi come una chat online. Perfetto per compiti semplici: riformulazione, riassunto breve, classificazione.
- Modello 3B Q4
- Da 10 a 20 token/sec. L’uso resta confortevole: si legge mentre il modello scrive. Il punto di equilibrio ideale per un uso quotidiano su CPU.
- Modello 7B–8B Q4
- Da 4 a 10 token/sec. Utilizzabile, ma bisogna aspettare. Adatto a compiti asincroni (analizzare un testo, generare una bozza).
- Modello 13B–14B Q4
- Da 2 a 5 token/sec. Al limite del tollerabile. Riservalo alle attività batch, non alla chat interattiva.
- Superiore a 14B
- Possibile ma doloroso. Meglio noleggiare un'ora di GPU cloud che eseguire un 32B su CPU.
#Modelli raccomandati in base alla RAM disponibile
Con la CPU, tutta la RAM di sistema può essere utilizzata dal modello, ma bisogna lasciare un margine per il sistema operativo e le tue applicazioni. Considera da 4 a 6 GB riservati al sistema. Il resto determina le dimensioni del modello che puoi eseguire.
#8 GB di RAM: modelli da 2B a 4B
- Qwen 3.5 2B Q4_K_M
- ≈1,9 GB. Ultra-rapido, multimodale, fino a 256k di contesto e licenza Apache 2.0. Adatto per riformulare, tradurre, classificare.
- Granite 4.2 3B Q4_K_M
- ≈2,2 GB. Molto parsimonioso nell'uso delle risorse ed efficiente nell'uso dei token, firmato IBM, licenza Apache 2.0. Parla un buon francese.
- Qwen 3.5 4B Q4_K_M
- ≈3,4 GB. Il nuovo modello piccolo predefinito. Valido nella programmazione e in francese.
- Gemma 4 E2B Q4 (QAT)
- ≈4,3 GB. Compatto e multimodale, firmato Google, passato alla licenza Apache 2.0 nel 2026.
#16 GB di RAM: modelli 8B–12B senza difficoltà
- Granite 4.2 8B Q4_K_M
- ≈5,3 GB. Molto efficiente in termini di token, 128k di contesto, licenza Apache 2.0. Rapido da caricare.
- Qwen 3.5 9B Q4_K_M
- ≈6,6 GB. LA scelta per 8 GB nel 2026: 256k di contesto, visione, eccellente nel ragionamento e in francese.
- Gemma 4 12B Q4_K_M
- ≈7,6 GB. Multimodale e efficiente, licenza Apache 2.0. Un passo in avanti se la tua RAM lo permette.
- Qwen 2.5 Coder 7B base Q4_K_M
- ≈4,7 GB. L'eccezione che resta attuale: il punto di riferimento nel 2026 per l'autocompletamento inline del codice (FIM) in locale.
#32 GB di RAM: si può ambire a un 24B
- Mistral Small 24B Q4_K_M
- ≈14 GB. Generalista, molto buono in francese, ma da 3 a 5 token/sec su CPU.
- gpt-oss 20B Q4 (MXFP4)
- ≈14 GB. Modello di OpenAI con pesi aperti, molto veloce grazie al formato MXFP4, 131k di contesto.
- Qwen 3.8 27B Q4_K_M (al limite)
- ≈18 GB. 262k di contesto, visione, licenza Apache 2.0. Possibile ma lento, ~2 token/sec. Più utile in batch — ricorda di impostare il livello di ragionamento su low per evitare che ragioni eccessivamente.
#1. Installare Ollama (modalità CPU automatica)
Ollama è lo strumento più semplice per iniziare. Rileva automaticamente l'assenza di una GPU e passa alla CPU senza configurazioni particolari. Il daemon è in ascolto per impostazione predefinita su http://localhost:11434.
Su Windows e macOS, scarica il programma di installazione da ollama.com. Non servono impostazioni specifiche per la modalità CPU — Ollama fa la scelta giusta da solo.
Il comando ollama ps deve mostrare lo stato del daemon. Se una conversazione è in corso, la colonna PROCESSOR indicherà 100% CPU: è esattamente ciò che vogliamo qui.
#2. Tre modelli da confrontare solo su CPU
Con 16 GB di RAM, la domanda non è «quale modello», ma «quale tra i tre piccoli modelli di punta del 2026». Scaricali tutti e tre e fatti un'opinione in un'ora.
- Qwen 3.5 4B
- Il miglior modello polivalente di queste dimensioni. Molto valido in francese, buono nella programmazione, 256k di contesto, segue bene le istruzioni. Il più lento dei tre (dato che ha 4B parametri).
- Granite 4.2 3B
- Molto sobrio e efficiente in termini di token, firmato IBM. Buono nel seguire istruzioni, licenza Apache 2.0. Buon compromesso tra velocità e qualità.
- Gemma 4 E2B
- Il più veloce dei tre. Multimodale, qualità sorprendente per le sue dimensioni. Ideale se vuoi risposte quasi in tempo reale su una CPU modesta. Meno valido nella programmazione rispetto agli altri due.
L'opzione --verbose mostra le statistiche in fondo a ogni risposta: prompt eval rate, eval rate (token/sec in generazione), total duration. È la tua metrica di riferimento su questa macchina.
#3. Benchmark tokens/sec: ordini di grandezza
Ecco degli ordini di grandezza su macchine rappresentative, senza GPU, con Ollama (che si basa su llama.cpp) e quantizzazione Q4_K_M. I tuoi risultati varieranno di ±20% a seconda del contesto, della memoria e della frequenza DDR.
#Intel Core i5-12400 + DDR4-3200 16 GB
- Gemma 4 E2B Q4
- ≈ 26 token/sec in generazione
- Granite 4.2 3B Q4_K_M
- ≈ 20 token/sec
- Qwen 3.5 4B Q4_K_M
- ≈ 15 token/sec
- Granite 4.2 8B Q4_K_M
- ≈ 8 token/sec
- Qwen 3.5 9B Q4_K_M
- ≈ 6 token/sec
#Intel Core i7-13700K + DDR5-5600 32 GB
- Gemma 4 E2B Q4
- ≈ 40 token/sec
- Granite 4.2 3B Q4_K_M
- ≈ 30 token/sec
- Qwen 3.5 4B Q4_K_M
- ≈ 23 token al secondo
- Qwen 3.5 9B Q4_K_M
- ≈ 12 token/sec
- Mistral Small 24B Q4_K_M
- ≈ 4 token/sec
#AMD Ryzen 7 7700X + DDR5-6000 32 GB
- Gemma 4 E2B Q4
- ≈ 44 token/sec
- Granite 4.2 3B Q4_K_M
- ≈ 32 token/sec
- Qwen 3.5 4B Q4_K_M
- ≈ 24 token/sec
- Granite 4.2 8B Q4_K_M
- ≈ 13 token/sec
- Qwen 3.5 9B Q4_K_M
- ≈ 11 token/sec
- Mistral Small 24B Q4_K_M
- ≈ 5 token/sec
#4. Compilare llama.cpp con AVX-512 (avanzato)
Ollama include binari generici precompilati di llama.cpp. Compilando manualmente llama.cpp con i set di istruzioni della tua CPU (AVX2, AVX-512, AMX), puoi ottenere dal 10 al 30 % di token al secondo in più su alcuni processori. Riservato agli Intel Core di 11ª generazione o successiva (Ice Lake / Rocket Lake / Sapphire Rapids) che supportano AVX-512.
Se il comando restituisce delle righe (avx512f, avx512dq, ecc.), la tua CPU supporta AVX-512. Altrimenti, continua a usare Ollama standard: non avresti alcun vantaggio.
L'opzione -DGGML_NATIVE=ON permette al compilatore di rilevare automaticamente i set di istruzioni della tua CPU e attiva tutto ciò che è disponibile. È il metodo più semplice e più affidabile.
L'opzione -t definisce il numero di thread (inserisci il numero di core fisici, non logici). llama-bench restituisce una tabella con pp512 (prompt eval) e tg128 (generazione) in token/sec — il tuo nuovo riferimento per i confronti.
#Suggerimenti per ottenere più token al secondo su CPU
- 01Impostare il numero di threadPer impostazione predefinita Ollama utilizza tutti i core logici. Su alcune CPU con hyper-threading, limitare il numero di thread a quello dei core fisici (OLLAMA_NUM_THREADS=8 per un processore a 8 core) aumenta la velocità dal 5 al 15%.
- 02Mantenere il modello caricatoIl caricamento del modello richiede diversi secondi. OLLAMA_KEEP_ALIVE=30m mantiene il modello in RAM per 30 minuti dopo l'ultima richiesta. Senza GPU, è ancora più prezioso perché il ricaricamento è lento.
- 03Ridurre il contesto se possibilenum_ctx 2048 invece di 8192 risparmia RAM e accelera notevolmente. Mantieni un grande contesto solo per utilizzi che ne abbiano veramente bisogno (RAG, documenti lunghi).
- 04Chiudere Chrome e SlackUn LLM 7B su CPU satura la banda passante della memoria. Tutto ciò che accede anch'esso alla RAM (browser con 50 schede, Slack, Teams) gli sottrae cicli. Su una macchina con 16 GB, questo può fare la differenza tra 5 e 8 token/sec.
- 05Scegliere la memoria DDR compatibile più veloceSe fai un upgrade: DDR4-3200 → DDR4-3600 = +10%. DDR4 → DDR5-5600 = dal +30% al +50%. La CPU conta molto meno della memoria per l'inferenza LLM.
#Quando la CPU non basta più
Siamo onesti: senza GPU, alcuni utilizzi restano fuori portata. Se riconosci il tuo caso nell'elenco qui sotto, è il momento di prendere in considerazione una GPU anche modesta (una RTX 3060 da 12 GB usata a 250 € cambia la vita) oppure di noleggiare risorse cloud a ore.
- Chat interattivo con un 13B+
- Da 2 a 5 token/sec sono troppo pochi per l'IA conversazionale. Una GPU da 12 GB risolve il problema istantaneamente.
- RAG con un contesto ampio (16k+)
- Sulla CPU, i tempi di elaborazione del prompt eval aumentano enormemente. Una RTX 3060 elabora un prompt 8k in 1 secondo, un i7 impiega 30 secondi.
- Autocompletamento del codice in tempo reale
- Le estensioni di autocompletamento inline (Tabby e simili, in modalità FIM con Qwen 2.5 Coder 7B base) richiedono risposte in meno di 200 ms. Su CPU, non scenderai sotto 1–2 secondi. GPU obbligatoria.
- Generazione su larga scala
- Elaborare 1000 documenti = giorni su CPU, ore su GPU. Per un batch occasionale, RunPod o Vast.ai a 0,30 €/h completano il lavoro in una notte.
#Per approfondire
Hai un LLM locale su CPU che risponde. Alcuni sviluppi naturali in base alla tua prossima domanda :
- Scegliere la quantizzazione giusta
- Q4_K_M è una scelta predefinita ragionevole, ma anche Q5_K_M o Q3 possono essere adatti a seconda della tua RAM. La guida alla quantizzazione illustra i compromessi.
- Dotare il tutto di un'interfaccia
- Il terminale va bene per fare dei test. Open WebUI o LM Studio offrono un'interfaccia locale simile a ChatGPT in pochi minuti.
- Quando aggiungere una GPU
- Se fai il passo, la guida alla scelta della GPU confronta RTX 3060, 4060 e 4070, con i relativi benchmark LLM.
Hardware consigliato: Radeon RX 9070 XT 16 GB — per passare dall'uso della sola CPU a una GPU dedicata. Tutto l'hardware per l'IA →
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.