🇺🇸 Gemma 4 E4B
Multimodale con 4B effettivi (testo+immagine+audio). 140 lingue. Per laptop ed edge.
ollama run gemma4:e4b
Classifica aggiornata il 22/09/2026
Non hai una GPU? I moderni LLM da 1-7B funzionano correttamente su CPU grazie a llama.cpp e alle quantizzazioni Q4. Servono 8-16 GB di RAM e bisogna accettare velocità di 5-15 token/sec. Ecco le scelte migliori.
Multimodale con 4B effettivi (testo+immagine+audio). 140 lingue. Per laptop ed edge.
ollama run gemma4:e4b
Denso 3B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 40Q/8KV. Tool calling e FIM per il codice. Rilascio 29 aprile 2026.
ollama run granite4.1:3b
Gemma 4 E2B: 2B parametri effettivi (5,1B totali), circa 3 GB di VRAM in Q4 (pesi Ollama: 4,3 GB con QAT, 7,2 GB predefiniti). Multimodale testo e immagini, contesto 128k, Apache 2.0.
ollama run gemma4:e2b
Granite 4.1 (3B Apache 2.0): tag Ollama generico della famiglia IBM Granite 4.1, 128k ctx, tool calling e codice. Uscita a maggio 2026.
ollama run granite4.1
Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.
ollama pull glm-5.3
VLM 3B specializzato nell'estrazione di dati da documenti aziendali. OCR, tabelle, moduli.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Con GPU integrata / senza GPU |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | ✗ |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | ✗ |
| #3 | Gemma 4 E2B | 2B | 3 GB | 128 000 | Apache 2.0 | ✗ |
| #4 | Granite 4.1 | 3B | 1,7 GB | 128 000 | Apache 2.0 | ✗ |
| #5 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | ✗ |
| #6 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | ✗ |
| #7 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | ✗ |
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
Solo modelli ≤ 8B — oltre questa soglia, la velocità di generazione su CPU diventa troppo bassa. Forte bonus ai modelli ≤ 3B (molto veloci su CPU moderne) e alle licenze permissive.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
È possibile davvero eseguire un LLM senza GPU?
Sì — grazie a llama.cpp + quantizzazione Q4_K_M, un modello 7B raggiunge 5-10 token/sec su una CPU Ryzen 7 o Apple M1. Per un uso interattivo, punta a un modello da 1 a 3B (30-50 token/sec).
Quanti GB di RAM servono?
Per un modello 7B in Q4: almeno 8 GB di RAM, 16 GB raccomandati (il modello occupa circa 5 GB, il resto per sistema operativo e contesto). Per un modello 3B: 6-8 GB sono sufficienti. Per un modello 1B: 4 GB.
Quale CPU per un LLM?
Più core ci sono e maggiore è il supporto per AVX2/AVX-512, meglio è. Ryzen 7/9 recenti, Intel Core i7/i9 recenti, Apple M1/M2/M3: tutti eccellenti. Privilegia la memoria veloce (DDR5 > DDR4): la larghezza di banda della RAM è spesso un fattore limitante più dei core.
Una iGPU (Intel / AMD) può aiutare?
Marginalmente — Vulkan su iGPU offre un miglioramento del 20-40% rispetto alla sola CPU. Non è straordinario, ma vale la pena sfruttarlo. Sui Mac Apple Silicon, la GPU integrata è utilizzabile tramite Metal e fa una grande differenza (è la modalità 'unified memory').