Quale LLM per 4 GB di VRAM ?
4 GB di VRAM sono il minimo assoluto per eseguire un LLM in locale nel 2026. GTX 1650, GTX 1050 Ti, RTX 3050 Mobile… schede datate o di fascia bassissima. Puoi comunque installare Ollama e conversare con Qwen 3.5 2B o Granite 4.2 3B. Questa guida spiega esattamente cosa funziona, cosa non funziona e come sfruttare al massimo questi 4 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Per passare a 16 GB di VRAM: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#4 GB di VRAM nel 2026
#1. Quali GPU hanno 4 GB
- GTX 1650 (4 GB)
- Pascal-Turing 2019. Difficile da trovare nuova oggi; usata, prezzo variabile.
- GTX 1050 Ti (4 GB)
- Pascal 2016. Vecchia ma ancora funzionante. Usata, prezzo variabile.
- RTX 3050 Mobile 4 GB
- Versione laptop entry level.
- GTX 1630 (4 GB)
- Fascia d'ingresso più bassa, da evitare — prestazioni insufficienti anche per un LLM leggero.
#2. Modelli utilizzabili
| Modello | Quant | VRAM | OK? |
|---|---|---|---|
| Gemma 4 2B | Q5_K_M | 1,4 GB | ★★★★★ comodo |
| Qwen 3.5 2B | Q4_K_M | 1,9 GB | ★★★★★ comodo |
| Granite 4.2 3B | Q4_K_M | 2,2 GB | ★★★★★ |
| Qwen 3.5 4B | Q4_K_M | 2,3 GB | ★★★★ |
| Gemma 4 E2B | QAT | 4,3 GB | ⚠️ al limite (4 GB) |
| Granite 4.2 8B | Q4_K_M | 5,3 GB | ❌ supera la capacità della VRAM |
#3. Consigli per sfruttare al massimo 4 GB
- KV cache Q4
- OLLAMA_KV_CACHE_TYPE=q4_0 (invece di q8_0). Più aggressivo, risparmia il 50% della cache.
- Contesto massimo 2k
- Oltre questo limite, la memoria non basta più. 2k token = circa 5–10 frasi in francese, sufficienti per una chat semplice.
- Chiudi tutto il resto
- Chrome con accelerazione GPU, Discord, OBS — tutto consuma VRAM. Modalità minimalista obbligatoria.
- Nessun RAG
- Embedding + LLM = troppo. Limitati a una semplice chat senza documenti.
#Aggiornamento consigliato
- RTX 3060 12 GB (usato, prezzo variabile)
- Il salto più conveniente. +200 % di VRAM, accesso ai modelli 14B. Il miglior upgrade possibile per i LLM.
- RTX 5050 8 GB (prezzo da nuova da verificare, non monitorata)
- Se vuoi acquistare una scheda nuova. +100 % di VRAM, FP4 a prova di futuro.
- Mac mini M4 16 GB (normalmente sostituito da M5/M6; da verificare)
- Se passi a una piattaforma diversa. Memoria unificata, funzionamento silenzioso.
#Domande frequenti
È possibile eseguire un modello 7-8B con 4 GB di VRAM?+
Qual è il miglior LLM per 4 GB di VRAM?+
Basta una GTX 1650 da 4 GB per esplorare l'IA locale?+
Serve necessariamente una GPU? La mia CPU può bastare?+
È possibile fare RAG con 4 GB di VRAM?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.