Principiante 11 minPer VRAM

Quale LLM per 6 GB di VRAM ?

Risposta diretta

Con 6 GB di VRAM, un modello da 4 miliardi di parametri in Q4 o Q5 entra comodamente in memoria con un contesto di diverse migliaia di token. Un modello da 7-8B in Q4 (da 4,6 a 5,2 GB) si carica ancora, ma senza margine: il contesto e la memoria riservata dal driver costringono a eseguirne una parte sul processore. Un altro aspetto sorprendente: sulle schede da 6 GB, è la larghezza di banda della memoria, non la capacità, a determinare la velocità, e può variare fino al doppio.

6 GB è la fascia di capacità della GTX 1660, della RTX 2060 e della RTX 3050 6 GB. Sono sufficienti per un vero assistente locale, a condizione di scegliere il modello giusto e di tenere conto anche della memoria occupata da ciò che non fa parte del modello. Questa pagina indica quali modelli entrano in memoria, quali schede da 6 GB sono più veloci di altre, come verificare che un modello rimanga interamente sulla scheda e cosa cambierebbe con 12 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Per passare a 16 GB di VRAM: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Ciò che 6 GB permettono: il calcolo completo della memoria

La VRAM non contiene solo i pesi. Ospita anche la cache del contesto, che cresce con la conversazione, i buffer di calcolo del motore e, su Windows, parte delle risorse utilizzate per la visualizzazione e dal browser. Su una scheda da 6 GB, si può considerare un budget di circa 5-5,5 GB per il modello e la sua cache, mentre il resto è occupato dal sistema. Il riferimento del sito per i pesi in Q4 è 3B ≈ 2 GB, 7-8B ≈ 5 GB.

Cosa può entrare in 6 GB (pesi in Q4, escluso il contesto)
ModelloPesi Q4Margine su 5,5 GBVerdetto
Gemma 4 2B1,2 GB4,3 GBMargine molto ampio, risposte brevi e rapide
Qwen 3.5 4B2,3 GB3,2 GBUso agevole, contesto di diverse migliaia di token
Phi-4 Mini 3.8B3 GB2,5 GBComodo
Granite 4.2 8B4,6 GB0,9 GBCi sta a malapena: contesto molto breve
Qwen 3 8B (Ollama)5,2 GB0,3 GBSupera la capacità della VRAM non appena il contesto si allunga
Qwen 3.5 9B6 GBnegativoNon entra

Le dimensioni provengono dal catalogo QuelLLM e dalla libreria Ollama. La colonna « margine » è una stima: presuppone 5,5 GB utilizzabili, una quantità che dipende dal tuo sistema e dalle tue applicazioni. Un modello da 8B è quindi possibile sulla carta, ma ti lascia meno di un gigabyte per la cache: è l'impostazione del contesto a determinare se l'esperienza è fluida o se gli strati vengono trasferiti al processore.

#Tre schede da 6 GB, tre velocità: la banda passante

La velocità di generazione è limitata dalla banda passante della memoria, divisa per la dimensione dei pesi letti ogni token. Due schede da 6 GB non sono quindi equivalenti. Secondo la tabella di Wikipedia sulla generazione GeForce 20, la RTX 2060 6 GB offre 336 GB/s su un bus da 192 bit. La RTX 3050 6 GB, più recente, ha solo un bus da 96 bit (NVIDIA) e 168 GB/s secondo la stessa enciclopedia: la metà.

Limite teorico di generazione in base alla scheda (banda passante ÷ dimensione dei pesi)
Scheda da 6 GBLarghezza di bandaModello da 2,3 GB (4B Q4)Modello da 4,6 GB (8B Q4)
RTX 2060 6 GB336 GB/scirca 146 t/scirca 73 t/s
RTX 3050 6 GB168 GB/scirca 73 t/scirca 37 t/s

Questi limiti non vengono mai raggiunti e non abbiamo misure da citare per queste schede: la percentuale effettiva dipende dal motore, dal contesto e dalla scheda. Ma il rapporto di 2 a 1 resta valido. Per l'IA locale, una RTX 2060 usata è quindi più veloce di una RTX 3050 6 GB nuova nonostante la sua età, e gli unici vantaggi della nuova scheda sono l'efficienza energetica e le funzionalità recenti. Per le GTX 1660, la variante conta: verifica il modello esatto, perché la memoria e il bus variano a seconda del modello.

#Il modello giusto per ogni uso con 6 GB

Chat, domande, scrittura
Un modello da 3 a 4B come Qwen 3.5 4B o Phi-4 Mini: risposte corrette e rapide, una finestra di contesto ampia. Per una qualità superiore in francese, prova il modello da 8B in Q4 con un contesto ridotto.
Codice
Un piccolo modello per il codice da 3 a 7B per l'autocompletamento, un modello generalista da 4B per le spiegazioni. Non aspettarti un agente di programmazione affidabile con un modello di queste dimensioni.
RAG e documenti
Un modello da 4B e un modello di embedding leggero: tutto entra in memoria. Il contesto è il fattore limitante: invia estratti brevi.
Visione e audio
Esistono modelli multimodali leggeri, ma l'encoder di immagini consuma memoria in aggiunta a quella del modello: prova con un modello da 2 a 4B.

Un errore frequente: i MoE come Qwen3-Coder 30B-A3B attivano solo 3 miliardi di parametri, il che fa pensare che possano stare in 6 GB. Non è così: tutti gli esperti devono essere in memoria e il file pesa 19 GB. L'unico modo per usarli è mantenere gli esperti sul processore, il che richiede molta RAM e comporta una forte perdita di velocità. La guida sui MoE spiega il principio.

#La modalità ibrida GPU e processore: utile, ma non magica

Quando un modello supera la capacità di memoria della scheda, Ollama e llama.cpp possono trasferire parte dei layer sulla CPU. Questo permette di caricare un 9B su 6 GB, ma la velocità diminuisce a gradini: i layer rimasti nella RAM vengono letti alla velocità della memoria di sistema, una frazione di quella della scheda. Per i MoE, llama.cpp offre un’opzione, --n-cpu-moe, che mantiene sulla CPU gli esperti di alcuni layer e lascia sulla scheda ciò che contribuisce più spesso al carico di calcolo. Un utente del repository llama.cpp riferisce circa 20 token al secondo con gpt-oss-20b e tutti gli esperti sulla CPU, su una macchina con DDR4-3200 a doppio canale, liberando al contempo la maggior parte della VRAM.

Questa testimonianza mostra che l'approccio funziona, non che sia adatto al tuo computer. Richiede 32 GB di RAM per un modello di queste dimensioni e la sua velocità dipende dalla larghezza di banda della memoria. Per un uso quotidiano con 6 GB, un modello 4B interamente sulla scheda resta più semplice e più veloce.

#Cinque impostazioni che contano con 6 GB

  1. 01
    Limitare il contesto
    La FAQ di Ollama indica una finestra predefinita di 4.096 token, regolabile. Con 6 GB, aumentala per incrementi successivi (6.000, 8.000) e monitora la memoria: ogni incremento aggiunge cache.
  2. 02
    Quantizzare la cache K/V
    Con Flash Attention attivo, OLLAMA_KV_CACHE_TYPE=q8_0 dimezza circa la memoria occupata dalla cache rispetto a f16, secondo le FAQ di Ollama. È il primo intervento per ottenere più margine.
  3. 03
    Chiudere ciò che consuma VRAM
    Un browser con accelerazione hardware, un gioco, un software di montaggio: ciascuno occupa memoria. Con 6 GB, usa la GPU per una sola attività alla volta.
  4. 04
    Verificare con ollama ps
    La colonna Processor indica dove è stato caricato il modello: l'obiettivo è 100 % GPU. Qualsiasi ripartizione tra CPU e GPU indica che parte del modello è stata trasferita nella RAM di sistema e che la velocità è inferiore.
  5. 05
    Scegliere la quantizzazione
    Q4_K_M è il giusto compromesso; su un 4B, puoi passare a Q5 o Q6 per migliorare la qualità, dato che c'è margine. La guida alla quantizzazione illustra nel dettaglio le differenze.
Impostazioni per una scheda da 6 GB (impostarle, poi riavviare Ollama)
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_CONTEXT_LENGTH=6144

Queste variabili si definiscono nell'ambiente del servizio Ollama (systemd su Linux, variabili di sistema su Windows, launchctl su macOS). La guida alla risoluzione degli errori GPU di Ollama spiega nel dettaglio cosa controllare quando un modello non riesce a caricarsi sulla scheda.

#Diagnosi: perché la generazione rallenta su una scheda da 6 GB

Su una scheda da 6 GB, un brusco rallentamento ha quasi sempre la stessa origine: una parte del modello o della cache non risiede più sulla scheda. La tabella seguente collega il sintomo osservato alla causa probabile e all'intervento da provare per primo.

Sintomi comuni e soluzioni
SintomoCausa probabileDa provare
Risposte fluide all’inizio, molto lente dopo qualche scambioLa cache del contesto ha riempito la VRAM e alcuni strati passano al processoreRidurre il contesto, quantizzare la cache in q8_0, riavviare la conversazione
Il modello si carica, ma ollama ps mostra una ripartizione CPU/GPUIl modello e il suo contesto superano la memoria disponibileScegliere un modello più piccolo o una quantizzazione più leggera
Velocità dimezzata dopo aver aperto un browser o un giocoQueste applicazioni occupano della VRAMDisattivare l'accelerazione hardware del browser, usare la GPU per una sola attività alla volta
Messaggio di errore di memoria durante il caricamentoIl driver riserva memoria e il modello non entra nella memoria disponibileVerificare il driver, liberare la scheda, provare un modello da 4B
Velocità deludente su una scheda recente a bus ridottoLa larghezza di banda è ridotta (RTX 3050 6 GB: bus a 96 bit)Scegliere un modello più piccolo invece di aspettare un miglioramento del software

Un ultimo punto sulla qualità: quanto più piccolo è un modello, tanto più commette errori nei compiti che richiedono conoscenze precise o ragionamenti lunghi. Con 6 GB, è meglio usare il modello per ciò che fa bene (riformulare, riassumere un testo fornito, rispondere a partire da estratti che gli fornisci, classificare, estrarre campi) piuttosto che per rispondere a memoria a domande fattuali. Fornire il testo di partenza nella conversazione, invece di contare su ciò che il modello «sa», è la pratica che dà i migliori risultati con un modello piccolo e rimane compatibile con un contesto breve.

#Passare a 8 o 12 GB: ciò che ogni livello sblocca

Il salto più vantaggioso è passare da 6 a 12 GB. Con 12 GB, un modello da 8-9B in Q4 (da 5 a 6 GB) rientra in memoria anche con un contesto lungo, e un 14B in Q4 (circa 9 GB) diventa possibile. Con 8 GB, un 8B rientra finalmente in memoria con un certo margine, ma un 14B rimane fuori portata. Non cercare un prezzo in questa pagina: i prezzi cambiano ogni settimana, e il monitoraggio del sito rileva quello più basso per ogni scheda.

Cosa permette ogni livello di VRAM
VRAMModelli utilizzabili agevolmenteCosa cambia
6 GB3-4B, 8B con contesto breveUn assistente locale discreto
8 GB8B con contesto medioPiù margine, Q5 possibile
12 GB8-9B con contesto lungo, 14B in Q4Il vero comfort per la chat e il RAG
16 GB14B in Q5, 24B in Q3-Q4 al limiteModelli di qualità superiore

#Domande frequenti

FAQ
Qual è il miglior LLM per 6 GB di VRAM?+
Un modello da 3 a 4 miliardi di parametri in Q4 o Q5, come Qwen 3.5 4B (2,3 GB) o Phi-4 Mini: rientra nella VRAM con un contesto sufficientemente ampio. Un 8B in Q4 (Granite 4.2 8B, 4,6 GB) è possibile con un contesto molto breve, con il rischio che parte dell'elaborazione passi al processore.
Che velocità aspettarsi con 6 GB di VRAM?+
Dipende soprattutto dalla larghezza di banda della scheda: 336 GB/s per una RTX 2060, 168 GB/s per una RTX 3050 6 GB. Un modello da 2,3 GB ha un limite teorico di 146 t/s sulla prima e 73 t/s sulla seconda; le velocità effettive sono più basse. Non abbiamo misure da citare.
È possibile eseguire Qwen 3.5 9B su 6 GB?+
Non interamente: nel catalogo QuelLLM pesa circa 6 GB in Q4, occupando quindi tutta la memoria della scheda senza lasciare spazio per la cache. In modalità ibrida GPU e processore, si carica ma diventa lento. Un modello da 4B o da 8B con un contesto breve è una scelta migliore.
RTX 2060 6 GB o RTX 3050 6 GB per l'IA locale?+
La RTX 2060: la sua banda passante di 336 GB/s è il doppio di quella della RTX 3050 6 GB (168 GB/s), ed è proprio la banda passante a determinare la velocità di generazione. La RTX 3050 6 GB prevale solo per il consumo e la generazione dell'architettura, non per la velocità di elaborazione.
6 GB sono sufficienti per un RAG locale?+
Sì, per un RAG semplice: un modello di embedding leggero e un modello da 4B possono stare insieme in memoria. Il fattore limitante è la lunghezza del contesto, che aumenta con il numero di estratti inviati al modello. Limitati a pochi estratti brevi e quantizza la cache K/V.
Un MoE da 30B può funzionare su 6 GB?+
Solo mantenendo gli esperti sul processore, e in tal caso serve molta RAM: il file di Qwen3-Coder 30B-A3B pesa 19 GB. Nonostante i suoi 3 miliardi di parametri attivi, non entra nella scheda. È un percorso avanzato, non la configurazione predefinita.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.