Home › Catalogo › Miglior LLM con 8 GB di VRAM nel 2026

Miglior LLM con 8 GB di VRAM nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 22/09/2026

8 GB di VRAM rappresentano il livello di ingresso per l'IA locale — RTX 3060 8GB, 4060, 5060, 3070, 2080, ecc. I modelli da 7 a 9B in Q4_K_M rientrano comodamente nella memoria disponibile. Ecco le scelte migliori per questa quantità di VRAM.

Offerte e alternative per l'IA locale

RTX 4060 Ti 8 GB : alternativa d'acquisto disponibile per l'IA locale — RTX 5060 Ti 16 GB :

Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →

Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.

Classifica

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.

Perché questa posizione Rientra nella memoria disponibile in Q5_K_M (~6 GB su 8 GB disponibili). 8B parametri, contesto di 131 072 token.
# HuggingFace : ibm-granite/granite-4.1-8b
Su RTX 4060 Ti 8GB
Q5_K_M
6 GB · 12 tok/s
2

🇺🇸 Gemma 4 12B

Google · 12B parametri · Apache 2.0 · 262 144 token ctx

Gemma 4 12B (Google): modello denso multimodale (testo, visione, audio), contesto da 256k, ~7 GB di VRAM in Q4. Apache 2.0, multilingue.

Perché questa posizione Rientra nella memoria disponibile con quantizzazione Q4_K_M (~7 GB su 8 GB disponibili). 12B parametri, contesto di 262 144 token.
# HuggingFace : google/gemma-4-12B
Su RTX 4060 Ti 8GB
Q4_K_M
7 GB · 18 tok/s
3

🇺🇸 Granite 4.2 8B

IBM · 8 miliardi di parametri · Apache 2.0 · 128 000 token ctx

Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.

Perché questa posizione Entra in memoria in Q5_K_M (~6 GB su 8 GB disponibili). 8B parametri, contesto di 128.000 token.
ollama pull granite4.2
Su RTX 4060 Ti 8GB
Q5_K_M
6 GB · 32 tok/s
4

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B parametri · Apache 2.0 · 16 000 token ctx

Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.

Perché questa posizione Entra in memoria in Q8 (~8 GB su 8 GB disponibili). 7B parametri, contesto di 16.000 token.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
Su RTX 4060 Ti 8GB
Q8
8 GB · 32 tok/s
5

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B parametri · MIT · 128 000 token ctx

GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.

Perché questa posizione Rientra in memoria in Q8 (~7 GB su 8 GB disponibili). 7B parametri, contesto di 128.000 token.
ollama pull glm-5.3
Su RTX 4060 Ti 8GB
Q8
7 GB · 32 tok/s
6

🇺🇸 OLMo 3 7B

Allen AI · 7B parametri · Apache 2.0 · 8 192 token ctx

Modello denso 7B aperto al 100% (pesi + dati + codice). Trasparenza totale per la ricerca.

Perché questa posizione Rientra nella memoria disponibile in Q5_K_M (~6 GB su 8 GB disponibili). 7B parametri, contesto di 8.192 token.
ollama run olmo-3:7b
Su RTX 4060 Ti 8GB
Q5_K_M
6 GB · 12 tok/s
7

🇨🇳 Qwen 3 8B

Alibaba · 8 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Modalità ibrida thinking/fast. 119 lingue, 32k nativi (131k tramite YaRN).

Perché questa posizione Rientra nella memoria disponibile in Q5_K_M (~6 GB su 8 GB disponibili). 8B parametri, contesto di 131 072 token.
ollama run qwen3:8b
Su RTX 4060 Ti 8GB
Q5_K_M
6 GB · 12 tok/s
8

🇺🇸 LFM2.5 7B

Liquid AI · 7B parametri · LFM Open License v1.0 · 32 768 token ctx

LFM2.5 7B (Liquid AI): Liquid Foundation Model denso, contesto da 32k, 4.1 GB di VRAM in Q4. Ottimizzato per CPU ed edge. Uscita a maggio 2026.

Perché questa posizione Rientra nella memoria disponibile in Q8 (~7 GB su 8 GB disponibili). 7B parametri, contesto di 32 768 token.
ollama pull lfm2.5
Su RTX 4060 Ti 8GB
Q8
7 GB · 32 tok/s

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Su RTX 4060 Ti 8GB
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#2 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 18 tok/s · Q4_K_M
#3 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 32 tok/s · Q5_K_M
#4 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 32 tok/s · Q8
#5 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 tok/s · Q8
#6 OLMo 3 7B 7B 5 GB 8 192 Apache 2.0 12 tok/s · Q5_K_M
#7 Qwen 3 8B 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 LFM2.5 7B 7B 4.1 GB 32 768 LFM Open License v1.0 32 tok/s · Q8
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Garanzia di rimborso di 30 giorni

Memo gratuito

Quale modello per la programmazione far girare sulla TUA macchina?

Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.

Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →

Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).

Metodologia della classifica

Filtro: VRAM Q4 ≤ 8 GB e ≥ 3 GB (si escludono i modelli ultracompatti sottoutilizzati). Si mantengono i modelli da 3 a 9B che rientrano in questi limiti in Q4_K_M, con margine per il contesto.

Criteri presi in considerazione:

  • VRAM Q4 ≤ 8 GB
  • Contesto utilizzabile (32k+)
  • Qualità paragonabile alla fascia superiore
  • Compatibile con Ollama / LM Studio

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

Quale LLM con 8 GB per iniziare?

Granite 4.1 8B Instruct è il punto di ingresso migliore. Mistral 7B, Llama 3.1 8B e Qwen 2.5 7B sono tutti eccellenti e sono gratuiti. Inizia con Ollama (ollama run mistral:7b-instruct).

È possibile eseguire Gemma 2 9B in 8 GB?

Solo Q4_K_M (≈ 6 GB per il modello + 1-2 GB per il contesto = ≈ 8 GB). Nessun margine per un contesto ampio. Preferisci Mistral 7B se vuoi gestire comodamente un contesto di 32k+ token.

Quale quantizzazione con 8 GB?

Q4_K_M per un 7-9B. Q5_K_M per un 3-5B. Q8 solo per un 3B o modelli più piccoli.

RTX 4060 vs RTX 3060 12 GB ?

La 4060 è più veloce in termini di puro throughput (+15-20%), ma è limitata a 8 GB: niente modelli 12B né contesti ampi. La 3060 da 12 GB è migliore per gli LLM nonostante appartenga a una fascia inferiore.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €