Principiante 10 minConfigurazione

LLM locale senza GPU (CPU): modelli in base alla RAM 8/16/32 GB

Eseguire un LLM locale senza GPU, usando solo la CPU, è del tutto possibile nel 2026. Con un Ryzen 7 o un i7 recente e 16 GB di RAM, puoi conversare con un modello 3B in tempo quasi reale, oppure lasciare girare un 7B per risposte meno urgenti. Questa guida ti indica quali modelli scegliere in base alla tua RAM, i dati reali misurati su macchine comuni e le impostazioni che fanno davvero la differenza.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché eseguire un LLM locale senza GPU?

Tutte le guide sull'IA locale partono dal presupposto che tu abbia una RTX 4070 nel tuo PC tower. La realtà è che la stragrande maggioranza dei laptop, dei PC desktop professionali e dei mini-PC utilizza una GPU integrata o non ha alcuna scheda dedicata. Buona notizia: un LLM eseguito solo sulla CPU funziona.

Tre ragioni tipiche per usare solo la CPU: un laptop senza GPU NVIDIA (la maggior parte dei Dell, Lenovo e dei vecchi Mac Intel), un PC desktop professionale con una iGPU Intel o AMD, oppure un server Linux headless che non si vuole dotare di una GPU. In tutti e tre i casi, la questione non è "funziona o no" ma "quale modello rimane utilizzabile".

i
Il vero fattore limitante: la RAM, non la CPU
Con la sola CPU, è la larghezza di banda della memoria a limitare i token al secondo, non la potenza bruta del processore. Un Ryzen 7 e un i5 recenti danno spesso risultati molto simili sullo stesso modello.

#Ciò che puoi aspettarti in pratica

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Prima di scaricare qualsiasi cosa, calibra le tue aspettative. Un LLM locale eseguito sulla CPU, senza GPU, non ha la stessa reattività di ChatGPT o di un modello su RTX 4090. Ecco gli ordini di grandezza realistici nel 2026:

Modello 1B–2B Q4
Da 20 a 40 token/sec su una CPU recente. Molto fluido, quasi come una chat online. Perfetto per compiti semplici: riformulazione, riassunto breve, classificazione.
Modello 3B Q4
Da 10 a 20 token/sec. L’uso resta confortevole: si legge mentre il modello scrive. Il punto di equilibrio ideale per un uso quotidiano su CPU.
Modello 7B–8B Q4
Da 4 a 10 token/sec. Utilizzabile, ma bisogna aspettare. Adatto a compiti asincroni (analizzare un testo, generare una bozza).
Modello 13B–14B Q4
Da 2 a 5 token/sec. Al limite del tollerabile. Riservalo alle attività batch, non alla chat interattiva.
Superiore a 14B
Possibile ma doloroso. Meglio noleggiare un'ora di GPU cloud che eseguire un 32B su CPU.
→
Riferimento mentale
Sotto i 5 token/sec, la chat interattiva diventa frustrante. Sopra i 15 token/sec, leggi alla stessa velocità con cui il modello scrive. Punta a questa seconda fascia.

#Modelli raccomandati in base alla RAM disponibile

Con la CPU, tutta la RAM di sistema può essere utilizzata dal modello, ma bisogna lasciare un margine per il sistema operativo e le tue applicazioni. Considera da 4 a 6 GB riservati al sistema. Il resto determina le dimensioni del modello che puoi eseguire.

#8 GB di RAM: modelli da 2B a 4B

Qwen 3.5 2B Q4_K_M
≈1,9 GB. Ultra-rapido, multimodale, fino a 256k di contesto e licenza Apache 2.0. Adatto per riformulare, tradurre, classificare.
Granite 4.2 3B Q4_K_M
≈2,2 GB. Molto parsimonioso nell'uso delle risorse ed efficiente nell'uso dei token, firmato IBM, licenza Apache 2.0. Parla un buon francese.
Qwen 3.5 4B Q4_K_M
≈3,4 GB. Il nuovo modello piccolo predefinito. Valido nella programmazione e in francese.
Gemma 4 E2B Q4 (QAT)
≈4,3 GB. Compatto e multimodale, firmato Google, passato alla licenza Apache 2.0 nel 2026.

#16 GB di RAM: modelli 8B–12B senza difficoltà

Granite 4.2 8B Q4_K_M
≈5,3 GB. Molto efficiente in termini di token, 128k di contesto, licenza Apache 2.0. Rapido da caricare.
Qwen 3.5 9B Q4_K_M
≈6,6 GB. LA scelta per 8 GB nel 2026: 256k di contesto, visione, eccellente nel ragionamento e in francese.
Gemma 4 12B Q4_K_M
≈7,6 GB. Multimodale e efficiente, licenza Apache 2.0. Un passo in avanti se la tua RAM lo permette.
Qwen 2.5 Coder 7B base Q4_K_M
≈4,7 GB. L'eccezione che resta attuale: il punto di riferimento nel 2026 per l'autocompletamento inline del codice (FIM) in locale.

#32 GB di RAM: si può ambire a un 24B

Mistral Small 24B Q4_K_M
≈14 GB. Generalista, molto buono in francese, ma da 3 a 5 token/sec su CPU.
gpt-oss 20B Q4 (MXFP4)
≈14 GB. Modello di OpenAI con pesi aperti, molto veloce grazie al formato MXFP4, 131k di contesto.
Qwen 3.8 27B Q4_K_M (al limite)
≈18 GB. 262k di contesto, visione, licenza Apache 2.0. Possibile ma lento, ~2 token/sec. Più utile in batch — ricorda di impostare il livello di ragionamento su low per evitare che ragioni eccessivamente.
!
Quantizzazione più aggressiva?
Q3_K_M risparmia ~20 % di RAM rispetto a Q4_K_M, ma la qualità diminuisce visibilmente sui modelli <7B. Per un modello da 1B–3B, usa almeno Q4_K_M. Per un modello da 13B su 16 GB, Q3 può salvare la situazione.

#1. Installare Ollama (modalità CPU automatica)

Ollama è lo strumento più semplice per iniziare. Rileva automaticamente l'assenza di una GPU e passa alla CPU senza configurazioni particolari. Il daemon è in ascolto per impostazione predefinita su http://localhost:11434.

Linux — script di installazione ufficiale
curl -fsSL https://ollama.com/install.sh | sh

Su Windows e macOS, scarica il programma di installazione da ollama.com. Non servono impostazioni specifiche per la modalità CPU — Ollama fa la scelta giusta da solo.

Verificare che Ollama sia in esecuzione
ollama --version
ollama ps

Il comando ollama ps deve mostrare lo stato del daemon. Se una conversazione è in corso, la colonna PROCESSOR indicherà 100% CPU: è esattamente ciò che vogliamo qui.

#2. Tre modelli da confrontare solo su CPU

Con 16 GB di RAM, la domanda non è «quale modello», ma «quale tra i tre piccoli modelli di punta del 2026». Scaricali tutti e tre e fatti un'opinione in un'ora.

Scaricare i tre challenger
ollama pull qwen3.5:4b
ollama pull granite4.2:3b
ollama pull gemma4:e2b-it-qat
Qwen 3.5 4B
Il miglior modello polivalente di queste dimensioni. Molto valido in francese, buono nella programmazione, 256k di contesto, segue bene le istruzioni. Il più lento dei tre (dato che ha 4B parametri).
Granite 4.2 3B
Molto sobrio e efficiente in termini di token, firmato IBM. Buono nel seguire istruzioni, licenza Apache 2.0. Buon compromesso tra velocità e qualità.
Gemma 4 E2B
Il più veloce dei tre. Multimodale, qualità sorprendente per le sue dimensioni. Ideale se vuoi risposte quasi in tempo reale su una CPU modesta. Meno valido nella programmazione rispetto agli altri due.
Avviare un benchmark conversazionale
ollama run gemma4:e2b-it-qat --verbose
>>> Explique en 3 phrases la différence entre une LLC et une SAS.

L'opzione --verbose mostra le statistiche in fondo a ogni risposta: prompt eval rate, eval rate (token/sec in generazione), total duration. È la tua metrica di riferimento su questa macchina.

→
Confrontare scientificamente
Poni esattamente la stessa domanda ai tre modelli, nello stesso ordine, a freddo (primo avvio). Confronta: qualità della risposta, eval rate visualizzato, tempo totale. Il «migliore» dipende dal tuo utilizzo, non da una classifica assoluta.

#3. Benchmark tokens/sec: ordini di grandezza

Ecco degli ordini di grandezza su macchine rappresentative, senza GPU, con Ollama (che si basa su llama.cpp) e quantizzazione Q4_K_M. I tuoi risultati varieranno di ±20% a seconda del contesto, della memoria e della frequenza DDR.

#Intel Core i5-12400 + DDR4-3200 16 GB

Gemma 4 E2B Q4
≈ 26 token/sec in generazione
Granite 4.2 3B Q4_K_M
≈ 20 token/sec
Qwen 3.5 4B Q4_K_M
≈ 15 token/sec
Granite 4.2 8B Q4_K_M
≈ 8 token/sec
Qwen 3.5 9B Q4_K_M
≈ 6 token/sec

#Intel Core i7-13700K + DDR5-5600 32 GB

Gemma 4 E2B Q4
≈ 40 token/sec
Granite 4.2 3B Q4_K_M
≈ 30 token/sec
Qwen 3.5 4B Q4_K_M
≈ 23 token al secondo
Qwen 3.5 9B Q4_K_M
≈ 12 token/sec
Mistral Small 24B Q4_K_M
≈ 4 token/sec

#AMD Ryzen 7 7700X + DDR5-6000 32 GB

Gemma 4 E2B Q4
≈ 44 token/sec
Granite 4.2 3B Q4_K_M
≈ 32 token/sec
Qwen 3.5 4B Q4_K_M
≈ 24 token/sec
Granite 4.2 8B Q4_K_M
≈ 13 token/sec
Qwen 3.5 9B Q4_K_M
≈ 11 token/sec
Mistral Small 24B Q4_K_M
≈ 5 token/sec
i
Come interpretare questi numeri
Salta il 50 % tra DDR4-3200 e DDR5-6000 sullo stesso modello. Sulla CPU, la tua RAM conta di più del tuo processore. Una DDR5 veloce vale spesso la pena prima di aggiornare la CPU.

#4. Compilare llama.cpp con AVX-512 (avanzato)

Ollama include binari generici precompilati di llama.cpp. Compilando manualmente llama.cpp con i set di istruzioni della tua CPU (AVX2, AVX-512, AMX), puoi ottenere dal 10 al 30 % di token al secondo in più su alcuni processori. Riservato agli Intel Core di 11ª generazione o successiva (Ice Lake / Rocket Lake / Sapphire Rapids) che supportano AVX-512.

Verificare il supporto AVX-512 (Linux)
grep -o 'avx512[a-z_]*' /proc/cpuinfo | sort -u

Se il comando restituisce delle righe (avx512f, avx512dq, ecc.), la tua CPU supporta AVX-512. Altrimenti, continua a usare Ollama standard: non avresti alcun vantaggio.

Clonare e compilare llama.cpp con AVX-512
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build \
  -DGGML_NATIVE=ON \
  -DGGML_AVX512=ON \
  -DGGML_AVX512_VBMI=ON \
  -DGGML_AVX512_VNNI=ON
cmake --build build --config Release -j

L'opzione -DGGML_NATIVE=ON permette al compilatore di rilevare automaticamente i set di istruzioni della tua CPU e attiva tutto ciò che è disponibile. È il metodo più semplice e più affidabile.

Testare con un modello GGUF
./build/bin/llama-bench -m qwen3.5-9b-Q4_K_M.gguf -t 8

L'opzione -t definisce il numero di thread (inserisci il numero di core fisici, non logici). llama-bench restituisce una tabella con pp512 (prompt eval) e tg128 (generazione) in token/sec — il tuo nuovo riferimento per i confronti.

!
AVX-512 sui processori Intel per il grande pubblico: attenzione
I processori Intel Core di 12ª e 13ª generazione (Alder Lake, Raptor Lake) hanno AVX-512 disattivato per impostazione predefinita nel BIOS da un aggiornamento del microcodice del 2022. Su queste CPU, compilare con AVX-512 non ti darà alcun vantaggio: rimani su AVX2.

#Suggerimenti per ottenere più token al secondo su CPU

  1. 01
    Impostare il numero di thread
    Per impostazione predefinita Ollama utilizza tutti i core logici. Su alcune CPU con hyper-threading, limitare il numero di thread a quello dei core fisici (OLLAMA_NUM_THREADS=8 per un processore a 8 core) aumenta la velocità dal 5 al 15%.
  2. 02
    Mantenere il modello caricato
    Il caricamento del modello richiede diversi secondi. OLLAMA_KEEP_ALIVE=30m mantiene il modello in RAM per 30 minuti dopo l'ultima richiesta. Senza GPU, è ancora più prezioso perché il ricaricamento è lento.
  3. 03
    Ridurre il contesto se possibile
    num_ctx 2048 invece di 8192 risparmia RAM e accelera notevolmente. Mantieni un grande contesto solo per utilizzi che ne abbiano veramente bisogno (RAG, documenti lunghi).
  4. 04
    Chiudere Chrome e Slack
    Un LLM 7B su CPU satura la banda passante della memoria. Tutto ciò che accede anch'esso alla RAM (browser con 50 schede, Slack, Teams) gli sottrae cicli. Su una macchina con 16 GB, questo può fare la differenza tra 5 e 8 token/sec.
  5. 05
    Scegliere la memoria DDR compatibile più veloce
    Se fai un upgrade: DDR4-3200 → DDR4-3600 = +10%. DDR4 → DDR5-5600 = dal +30% al +50%. La CPU conta molto meno della memoria per l'inferenza LLM.

#Quando la CPU non basta più

Siamo onesti: senza GPU, alcuni utilizzi restano fuori portata. Se riconosci il tuo caso nell'elenco qui sotto, è il momento di prendere in considerazione una GPU anche modesta (una RTX 3060 da 12 GB usata a 250 € cambia la vita) oppure di noleggiare risorse cloud a ore.

Chat interattivo con un 13B+
Da 2 a 5 token/sec sono troppo pochi per l'IA conversazionale. Una GPU da 12 GB risolve il problema istantaneamente.
RAG con un contesto ampio (16k+)
Sulla CPU, i tempi di elaborazione del prompt eval aumentano enormemente. Una RTX 3060 elabora un prompt 8k in 1 secondo, un i7 impiega 30 secondi.
Autocompletamento del codice in tempo reale
Le estensioni di autocompletamento inline (Tabby e simili, in modalità FIM con Qwen 2.5 Coder 7B base) richiedono risposte in meno di 200 ms. Su CPU, non scenderai sotto 1–2 secondi. GPU obbligatoria.
Generazione su larga scala
Elaborare 1000 documenti = giorni su CPU, ore su GPU. Per un batch occasionale, RunPod o Vast.ai a 0,30 €/h completano il lavoro in una notte.

#Per approfondire

Hai un LLM locale su CPU che risponde. Alcuni sviluppi naturali in base alla tua prossima domanda :

Scegliere la quantizzazione giusta
Q4_K_M è una scelta predefinita ragionevole, ma anche Q5_K_M o Q3 possono essere adatti a seconda della tua RAM. La guida alla quantizzazione illustra i compromessi.
Dotare il tutto di un'interfaccia
Il terminale va bene per fare dei test. Open WebUI o LM Studio offrono un'interfaccia locale simile a ChatGPT in pochi minuti.
Quando aggiungere una GPU
Se fai il passo, la guida alla scelta della GPU confronta RTX 3060, 4060 e 4070, con i relativi benchmark LLM.

Hardware consigliato: Radeon RX 9070 XT 16 GB — per passare dall'uso della sola CPU a una GPU dedicata. Tutto l'hardware per l'IA →

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.