Quale LLM per 6 GB di VRAM ?
Con 6 GB di VRAM, un modello da 4 miliardi di parametri in Q4 o Q5 entra comodamente in memoria con un contesto di diverse migliaia di token. Un modello da 7-8B in Q4 (da 4,6 a 5,2 GB) si carica ancora, ma senza margine: il contesto e la memoria riservata dal driver costringono a eseguirne una parte sul processore. Un altro aspetto sorprendente: sulle schede da 6 GB, è la larghezza di banda della memoria, non la capacità, a determinare la velocità, e può variare fino al doppio.
6 GB è la fascia di capacità della GTX 1660, della RTX 2060 e della RTX 3050 6 GB. Sono sufficienti per un vero assistente locale, a condizione di scegliere il modello giusto e di tenere conto anche della memoria occupata da ciò che non fa parte del modello. Questa pagina indica quali modelli entrano in memoria, quali schede da 6 GB sono più veloci di altre, come verificare che un modello rimanga interamente sulla scheda e cosa cambierebbe con 12 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Per passare a 16 GB di VRAM: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Ciò che 6 GB permettono: il calcolo completo della memoria
La VRAM non contiene solo i pesi. Ospita anche la cache del contesto, che cresce con la conversazione, i buffer di calcolo del motore e, su Windows, parte delle risorse utilizzate per la visualizzazione e dal browser. Su una scheda da 6 GB, si può considerare un budget di circa 5-5,5 GB per il modello e la sua cache, mentre il resto è occupato dal sistema. Il riferimento del sito per i pesi in Q4 è 3B ≈ 2 GB, 7-8B ≈ 5 GB.
| Modello | Pesi Q4 | Margine su 5,5 GB | Verdetto |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,3 GB | Margine molto ampio, risposte brevi e rapide |
| Qwen 3.5 4B | 2,3 GB | 3,2 GB | Uso agevole, contesto di diverse migliaia di token |
| Phi-4 Mini 3.8B | 3 GB | 2,5 GB | Comodo |
| Granite 4.2 8B | 4,6 GB | 0,9 GB | Ci sta a malapena: contesto molto breve |
| Qwen 3 8B (Ollama) | 5,2 GB | 0,3 GB | Supera la capacità della VRAM non appena il contesto si allunga |
| Qwen 3.5 9B | 6 GB | negativo | Non entra |
Le dimensioni provengono dal catalogo QuelLLM e dalla libreria Ollama. La colonna « margine » è una stima: presuppone 5,5 GB utilizzabili, una quantità che dipende dal tuo sistema e dalle tue applicazioni. Un modello da 8B è quindi possibile sulla carta, ma ti lascia meno di un gigabyte per la cache: è l'impostazione del contesto a determinare se l'esperienza è fluida o se gli strati vengono trasferiti al processore.
#Tre schede da 6 GB, tre velocità: la banda passante
La velocità di generazione è limitata dalla banda passante della memoria, divisa per la dimensione dei pesi letti ogni token. Due schede da 6 GB non sono quindi equivalenti. Secondo la tabella di Wikipedia sulla generazione GeForce 20, la RTX 2060 6 GB offre 336 GB/s su un bus da 192 bit. La RTX 3050 6 GB, più recente, ha solo un bus da 96 bit (NVIDIA) e 168 GB/s secondo la stessa enciclopedia: la metà.
| Scheda da 6 GB | Larghezza di banda | Modello da 2,3 GB (4B Q4) | Modello da 4,6 GB (8B Q4) |
|---|---|---|---|
| RTX 2060 6 GB | 336 GB/s | circa 146 t/s | circa 73 t/s |
| RTX 3050 6 GB | 168 GB/s | circa 73 t/s | circa 37 t/s |
Questi limiti non vengono mai raggiunti e non abbiamo misure da citare per queste schede: la percentuale effettiva dipende dal motore, dal contesto e dalla scheda. Ma il rapporto di 2 a 1 resta valido. Per l'IA locale, una RTX 2060 usata è quindi più veloce di una RTX 3050 6 GB nuova nonostante la sua età, e gli unici vantaggi della nuova scheda sono l'efficienza energetica e le funzionalità recenti. Per le GTX 1660, la variante conta: verifica il modello esatto, perché la memoria e il bus variano a seconda del modello.
- Quale LLM su RTX 2060
- Quale LLM usare su una RTX 3050
- Quale LLM su GTX 1650 / 1660
- Quale LLM su GTX 1060
#Il modello giusto per ogni uso con 6 GB
- Chat, domande, scrittura
- Un modello da 3 a 4B come Qwen 3.5 4B o Phi-4 Mini: risposte corrette e rapide, una finestra di contesto ampia. Per una qualità superiore in francese, prova il modello da 8B in Q4 con un contesto ridotto.
- Codice
- Un piccolo modello per il codice da 3 a 7B per l'autocompletamento, un modello generalista da 4B per le spiegazioni. Non aspettarti un agente di programmazione affidabile con un modello di queste dimensioni.
- RAG e documenti
- Un modello da 4B e un modello di embedding leggero: tutto entra in memoria. Il contesto è il fattore limitante: invia estratti brevi.
- Visione e audio
- Esistono modelli multimodali leggeri, ma l'encoder di immagini consuma memoria in aggiunta a quella del modello: prova con un modello da 2 a 4B.
Un errore frequente: i MoE come Qwen3-Coder 30B-A3B attivano solo 3 miliardi di parametri, il che fa pensare che possano stare in 6 GB. Non è così: tutti gli esperti devono essere in memoria e il file pesa 19 GB. L'unico modo per usarli è mantenere gli esperti sul processore, il che richiede molta RAM e comporta una forte perdita di velocità. La guida sui MoE spiega il principio.
#La modalità ibrida GPU e processore: utile, ma non magica
Quando un modello supera la capacità di memoria della scheda, Ollama e llama.cpp possono trasferire parte dei layer sulla CPU. Questo permette di caricare un 9B su 6 GB, ma la velocità diminuisce a gradini: i layer rimasti nella RAM vengono letti alla velocità della memoria di sistema, una frazione di quella della scheda. Per i MoE, llama.cpp offre un’opzione, --n-cpu-moe, che mantiene sulla CPU gli esperti di alcuni layer e lascia sulla scheda ciò che contribuisce più spesso al carico di calcolo. Un utente del repository llama.cpp riferisce circa 20 token al secondo con gpt-oss-20b e tutti gli esperti sulla CPU, su una macchina con DDR4-3200 a doppio canale, liberando al contempo la maggior parte della VRAM.
Questa testimonianza mostra che l'approccio funziona, non che sia adatto al tuo computer. Richiede 32 GB di RAM per un modello di queste dimensioni e la sua velocità dipende dalla larghezza di banda della memoria. Per un uso quotidiano con 6 GB, un modello 4B interamente sulla scheda resta più semplice e più veloce.
#Cinque impostazioni che contano con 6 GB
- 01Limitare il contestoLa FAQ di Ollama indica una finestra predefinita di 4.096 token, regolabile. Con 6 GB, aumentala per incrementi successivi (6.000, 8.000) e monitora la memoria: ogni incremento aggiunge cache.
- 02Quantizzare la cache K/VCon Flash Attention attivo, OLLAMA_KV_CACHE_TYPE=q8_0 dimezza circa la memoria occupata dalla cache rispetto a f16, secondo le FAQ di Ollama. È il primo intervento per ottenere più margine.
- 03Chiudere ciò che consuma VRAMUn browser con accelerazione hardware, un gioco, un software di montaggio: ciascuno occupa memoria. Con 6 GB, usa la GPU per una sola attività alla volta.
- 04Verificare con ollama psLa colonna Processor indica dove è stato caricato il modello: l'obiettivo è 100 % GPU. Qualsiasi ripartizione tra CPU e GPU indica che parte del modello è stata trasferita nella RAM di sistema e che la velocità è inferiore.
- 05Scegliere la quantizzazioneQ4_K_M è il giusto compromesso; su un 4B, puoi passare a Q5 o Q6 per migliorare la qualità, dato che c'è margine. La guida alla quantizzazione illustra nel dettaglio le differenze.
Queste variabili si definiscono nell'ambiente del servizio Ollama (systemd su Linux, variabili di sistema su Windows, launchctl su macOS). La guida alla risoluzione degli errori GPU di Ollama spiega nel dettaglio cosa controllare quando un modello non riesce a caricarsi sulla scheda.
- Quantizzare la cache KV
- Scegliere la quantizzazione
- Risolvere gli errori GPU di Ollama
- I modelli MoE spiegati
#Diagnosi: perché la generazione rallenta su una scheda da 6 GB
Su una scheda da 6 GB, un brusco rallentamento ha quasi sempre la stessa origine: una parte del modello o della cache non risiede più sulla scheda. La tabella seguente collega il sintomo osservato alla causa probabile e all'intervento da provare per primo.
| Sintomo | Causa probabile | Da provare |
|---|---|---|
| Risposte fluide all’inizio, molto lente dopo qualche scambio | La cache del contesto ha riempito la VRAM e alcuni strati passano al processore | Ridurre il contesto, quantizzare la cache in q8_0, riavviare la conversazione |
| Il modello si carica, ma ollama ps mostra una ripartizione CPU/GPU | Il modello e il suo contesto superano la memoria disponibile | Scegliere un modello più piccolo o una quantizzazione più leggera |
| Velocità dimezzata dopo aver aperto un browser o un gioco | Queste applicazioni occupano della VRAM | Disattivare l'accelerazione hardware del browser, usare la GPU per una sola attività alla volta |
| Messaggio di errore di memoria durante il caricamento | Il driver riserva memoria e il modello non entra nella memoria disponibile | Verificare il driver, liberare la scheda, provare un modello da 4B |
| Velocità deludente su una scheda recente a bus ridotto | La larghezza di banda è ridotta (RTX 3050 6 GB: bus a 96 bit) | Scegliere un modello più piccolo invece di aspettare un miglioramento del software |
Un ultimo punto sulla qualità: quanto più piccolo è un modello, tanto più commette errori nei compiti che richiedono conoscenze precise o ragionamenti lunghi. Con 6 GB, è meglio usare il modello per ciò che fa bene (riformulare, riassumere un testo fornito, rispondere a partire da estratti che gli fornisci, classificare, estrarre campi) piuttosto che per rispondere a memoria a domande fattuali. Fornire il testo di partenza nella conversazione, invece di contare su ciò che il modello «sa», è la pratica che dà i migliori risultati con un modello piccolo e rimane compatibile con un contesto breve.
#Passare a 8 o 12 GB: ciò che ogni livello sblocca
Il salto più vantaggioso è passare da 6 a 12 GB. Con 12 GB, un modello da 8-9B in Q4 (da 5 a 6 GB) rientra in memoria anche con un contesto lungo, e un 14B in Q4 (circa 9 GB) diventa possibile. Con 8 GB, un 8B rientra finalmente in memoria con un certo margine, ma un 14B rimane fuori portata. Non cercare un prezzo in questa pagina: i prezzi cambiano ogni settimana, e il monitoraggio del sito rileva quello più basso per ogni scheda.
| VRAM | Modelli utilizzabili agevolmente | Cosa cambia |
|---|---|---|
| 6 GB | 3-4B, 8B con contesto breve | Un assistente locale discreto |
| 8 GB | 8B con contesto medio | Più margine, Q5 possibile |
| 12 GB | 8-9B con contesto lungo, 14B in Q4 | Il vero comfort per la chat e il RAG |
| 16 GB | 14B in Q5, 24B in Q3-Q4 al limite | Modelli di qualità superiore |
- Monitoraggio dei prezzi delle schede grafiche per l'IA locale
- Quale LLM per 8 GB di VRAM
- Quale LLM per 12 GB di VRAM
- Fonte: libreria Ollama, Qwen3
- Fonte: FAQ ufficiale di Ollama
- Fonte: discussione llama.cpp su gpt-oss e --n-cpu-moe
#Domande frequenti
Qual è il miglior LLM per 6 GB di VRAM?+
Che velocità aspettarsi con 6 GB di VRAM?+
È possibile eseguire Qwen 3.5 9B su 6 GB?+
RTX 2060 6 GB o RTX 3050 6 GB per l'IA locale?+
6 GB sono sufficienti per un RAG locale?+
Un MoE da 30B può funzionare su 6 GB?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.