Home › Catalogo › Miglior LLM senza GPU (solo CPU) nel 2026

Miglior LLM senza GPU (solo CPU) nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 22/09/2026

Non hai una GPU? I moderni LLM da 1-7B funzionano correttamente su CPU grazie a llama.cpp e alle quantizzazioni Q4. Servono 8-16 GB di RAM e bisogna accettare velocità di 5-15 token/sec. Ecco le scelte migliori.

Classifica

1

🇺🇸 Gemma 4 E4B

Google · 4B parametri · Apache 2.0 · 128 000 token ctx

Multimodale con 4B effettivi (testo+immagine+audio). 140 lingue. Per laptop ed edge.

Perché questa posizione 4B parametri — funziona correttamente su CPU moderna (5-10 token/sec in Q4).
ollama run gemma4:e4b
VRAM Q4
10 GB
12 GB in Q8
2

🇺🇸 Granite 4.1 3B Instruct

IBM · 3B parametri · Apache 2.0 · 131 072 token ctx

Denso 3B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 40Q/8KV. Tool calling e FIM per il codice. Rilascio 29 aprile 2026.

Perché questa posizione 3B parametri — funziona correttamente su CPU moderna (30-50 token/sec in Q4).
ollama run granite4.1:3b
VRAM Q4
2 GB
3 GB in Q8
3

🇺🇸 Gemma 4 E2B

Google · 2B parametri · Apache 2.0 · 128 000 token ctx

Gemma 4 E2B: 2B parametri effettivi (5,1B totali), circa 3 GB di VRAM in Q4 (pesi Ollama: 4,3 GB con QAT, 7,2 GB predefiniti). Multimodale testo e immagini, contesto 128k, Apache 2.0.

Perché questa posizione 2B parametri — funziona correttamente su CPU moderna (30-50 token/sec in Q4).
ollama run gemma4:e2b
VRAM Q4
3 GB
5 GB in Q8
4

🇺🇸 Granite 4.1

IBM · 3B parametri · Apache 2.0 · 128 000 token ctx

Granite 4.1 (3B Apache 2.0): tag Ollama generico della famiglia IBM Granite 4.1, 128k ctx, tool calling e codice. Uscita a maggio 2026.

Perché questa posizione 3B parametri — funziona correttamente su CPU moderna (30-50 token/sec in Q4).
ollama run granite4.1
VRAM Q4
1,7 GB
3,2 GB in Q8
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B parametri · Apache 2.0 · 16 000 token ctx

Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.

Perché questa posizione 7B parametri — funziona correttamente su CPU moderna (5-10 token/sec in Q4).
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
VRAM Q4
4.2 GB
8 GB in Q8
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B parametri · MIT · 128 000 token ctx

GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.

Perché questa posizione 7B parametri — funziona correttamente su CPU moderna (5-10 token/sec in Q4).
ollama pull glm-5.3
VRAM Q4
4.1 GB
7 GB in Q8
7

🇺🇸 Granite 4.0 3B Vision

IBM · 3B parametri · Apache 2.0 · 16 384 token ctx

VLM 3B specializzato nell'estrazione di dati da documenti aziendali. OCR, tabelle, moduli.

Perché questa posizione 3B parametri — funziona correttamente su CPU moderna (30-50 token/sec in Q4).
# HuggingFace : ibm-granite/granite-4.0-3b-vision
VRAM Q4
2.2 GB
3,8 GB in Q8

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Con GPU integrata / senza GPU
#1 Gemma 4 E4B 4B 10 GB 128 000 Apache 2.0 ✗
#2 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 ✗
#3 Gemma 4 E2B 2B 3 GB 128 000 Apache 2.0 ✗
#4 Granite 4.1 3B 1,7 GB 128 000 Apache 2.0 ✗
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 ✗
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT ✗
#7 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0 ✗
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Garanzia di rimborso di 30 giorni

Metodologia della classifica

Solo modelli ≤ 8B — oltre questa soglia, la velocità di generazione su CPU diventa troppo bassa. Forte bonus ai modelli ≤ 3B (molto veloci su CPU moderne) e alle licenze permissive.

Criteri presi in considerazione:

  • Dimensione ≤ 8B (idealmente ≤ 3B)
  • Velocità CPU ≥ 5 token/s
  • RAM richiesta ≤ 16 GB
  • Qualità accettabile in Q4

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

È possibile davvero eseguire un LLM senza GPU?

Sì — grazie a llama.cpp + quantizzazione Q4_K_M, un modello 7B raggiunge 5-10 token/sec su una CPU Ryzen 7 o Apple M1. Per un uso interattivo, punta a un modello da 1 a 3B (30-50 token/sec).

Quanti GB di RAM servono?

Per un modello 7B in Q4: almeno 8 GB di RAM, 16 GB raccomandati (il modello occupa circa 5 GB, il resto per sistema operativo e contesto). Per un modello 3B: 6-8 GB sono sufficienti. Per un modello 1B: 4 GB.

Quale CPU per un LLM?

Più core ci sono e maggiore è il supporto per AVX2/AVX-512, meglio è. Ryzen 7/9 recenti, Intel Core i7/i9 recenti, Apple M1/M2/M3: tutti eccellenti. Privilegia la memoria veloce (DDR5 > DDR4): la larghezza di banda della RAM è spesso un fattore limitante più dei core.

Una iGPU (Intel / AMD) può aiutare?

Marginalmente — Vulkan su iGPU offre un miglioramento del 20-40% rispetto alla sola CPU. Non è straordinario, ma vale la pena sfruttarlo. Sui Mac Apple Silicon, la GPU integrata è utilizzabile tramite Metal e fa una grande differenza (è la modalità 'unified memory').

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €