Principiante 11 minPer VRAM

Quale LLM per 12 GB di VRAM ?

Risposta diretta

Con 12 GB di VRAM, scegli un modello da 12 a 14 miliardi di parametri in Q4 (Gemma 4 12B: 7 GB, Qwen 3 14B: 9 GB) o un modello 9B in Q8 (10 GB), con un margine da 1 a 3 GB per il contesto. I modelli da 20 a 24 miliardi richiedono 16 GB, quelli da 27 a 35 miliardi 24 GB.

Dodici gigabyte di VRAM permettono di eseguire modelli da 12 a 14 miliardi di parametri lasciando un margine. Questa guida indica quali modelli rientrano nella memoria disponibile, quali schede hanno davvero 12 GB, come ripartire la memoria per un RAG locale e quando passare a 16 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Per passare a 16 GB di VRAM: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#12 GB di VRAM: la soglia a cui diventano possibili i modelli da 14 miliardi di parametri

Con 12 GB di VRAM, puoi eseguire modelli da 12 a 14 miliardi di parametri in Q4 con un margine vero per il contesto, oppure un 9B in Q8. Secondo il catalogo QuelLLM, un Gemma 4 12B in Q4 pesa 7 GB, un Qwen 3 14B in Q4 pesa 9 GB, un Qwen 3.5 9B in Q8 pesa 10 GB. Il livello di 12 GB è quello in cui si abbandona la categoria dei modelli da 8 a 9 miliardi, più limitati in ragionamento e qualità di scrittura, senza ancora raggiungere i 24 miliardi, che richiedono 16 GB. Quelli che rimangono fuori portata sono i modelli da 27 a 35 miliardi di parametri, da 16 a 21 GB in Q4.

Cosa entra in 12 GB (pesi dei modelli del catalogo QuelLLM)
ModelloQ4Q5Q8Su 12 GB
Qwen 3.5 9B6 GB7 GB10 GBQ8 possibile, contesto breve
Gemma 4 12B7 GB9 GB13 GBQ4 o Q5; Q8 supera la memoria disponibile
Mistral Nemo 12B7 GB9 GB13 GBQ4 o Q5; Q8 supera la memoria disponibile
Qwen 3 14B9 GB11 GB16 GBQ4 con margine, Q5 al limite
Mistral Small 24B14 GB17 GB26 GBNo

Come leggere questa tabella: aggiungi al peso la cache KV e circa un gigabyte di margine. Un Qwen 3 14B in Q4 (9 GB) lascia così circa 2 GB per il contesto; un Qwen 3.5 9B in Q8 (10 GB) ne lascia solo uno, il che limita il contesto. Prima di procedere, una correzione: una versione precedente di questa guida indicava che il 9B in Q8 si poteva eseguire comodamente su 12 GB; il catalogo indica 10 GB di peso, quindi il margine è stretto.

#Schede da 12 GB: quelle che li hanno davvero

Molte famiglie di schede hanno versioni con capacità diverse; il nome da solo non basta. NVIDIA indica, per la sua famiglia RTX 4070, 16 GB per la 4070 Ti Super e 12 GB per le 4070 Ti, 4070 Super e 4070. La RTX 5070 offre 12 GB di GDDR7 su un bus da 192 bit, mentre la 5070 Ti ne ha 16. La RTX 3060 esiste nelle versioni da 12 GB e da 8 GB; quella da 12 GB è la più interessante per l'IA locale. Sul versante AMD, la guida alla RX 7700 XT la colloca in questa fascia.

Schede da 12 GB e guide dedicate
SchedaCapacitàGuide
RTX 3060 (versione 12 GB)12 GB GDDR6LLM su RTX 3060 12 GB
RTX 4070, 4070 Super, 4070 Ti12 GB GDDR6X o GDDR6LLM su RTX 4070
RTX 507012 GB GDDR7, 192 bitLLM su RTX 5070
RX 7700 XT12 GB (vedi la guida)LLM su RX 7700 XT

Per confrontare, la capacità è il criterio principale e la banda passante il secondo: a parità di capacità, più veloce è la memoria, più fluida è la generazione. I prezzi cambiano ogni settimana; il monitoraggio dei prezzi del sito fornisce il costo per gigabyte di VRAM delle schede da 12 GB e 16 GB, permettendo di capire se la fascia superiore vale il sovrapprezzo.

#Quali modelli scegliere su 12 GB in base all'uso

Un punto di partenza per ogni uso
UsoModello e quantizzazioneDimensione del modelloCosa sapere
Discussione generale in franceseMistral Nemo 12B Q59 GBContrassegnato come francese nel catalogo; 3 GB di margine
Ragionamento e scritturaQwen 3 14B Q49 GBCirca 2 GB per il contesto
Multimodale (immagini)Gemma 4 12B Q47 GBIl modulo immagine consuma memoria in più
Qualità massima di un 9BQwen 3.5 9B Q810 GBContesto limitato a qualche migliaio di token
Velocità e leggerezzaGranite 4.2 8B Q56 GBLascia 5 GB per un embedder o un contesto lungo

Per il codice, i modelli specializzati più potenti del catalogo superano i 12 GB: Devstral Small 2 24B pesa 14 GB in Q4 e Qwen3-Coder 30B-A3B 19 GB. Su 12 GB, rimani su un generico da 12 a 14 miliardi o su Qwen 2.5 Coder 14B, il cui catalogo offre 9 GB in Q4. Questi modelli si confrontano con quelli da 8 e 16 GB nei guide vicini.

→
Un criterio semplice per scegliere la quantizzazione
Mantieni almeno 2 GB liberi oltre ai pesi se usi un contesto di oltre 8 000 token. Se il margine è inferiore, scendi di un livello di quantizzazione (da Q8 a Q5, da Q5 a Q4) piuttosto che ridurre il contesto: la perdita di qualità di Q5 è bassa per un uso comune.

#Velocità: il calcolo da fare da soli

Con 12 GB come con altre capacità, la velocità di generazione è limitata dalla larghezza di banda della memoria della scheda divisa per la dimensione dei pesi letti a ogni token. Ogni produttore pubblica questo valore nella scheda tecnica della scheda, in GB/s. Basta dividerlo per il peso del modello per ottenere un limite teorico, che la velocità reale non raggiunge mai del tutto. La tabella riporta questo limite per 100 GB/s di larghezza di banda; moltiplica per il valore della tua scheda.

Limite teorico per ogni 100 GB/s di larghezza di banda
Modello in Q4Pesi lettiLimite massimo per ogni 100 GB/sEsempio per 300 GB/s
Granite 4.2 8B4,6 GB≈ 22 token/s≈ 65 token/s
Gemma 4 12B7 GB≈ 14 token/s≈ 43 token/s
Qwen 3 14B9 GB≈ 11 token/s≈ 33 token/s
Qwen 3.5 9B in Q810 GB10 token/s30 token/s

Questo limite spiega perché una quantizzazione più fine rallenta: passare da Q4 a Q8 quasi raddoppia la quantità di dati letti per i pesi. Spiega anche perché due schede con la stessa capacità possono differire: il bus di memoria conta. NVIDIA indica 192 bit per la RTX 5070 da 12 GB e 256 bit per la 5070 Ti da 16 GB. Non pubblichiamo valori di token al secondo per ciascuna scheda, perché manca una fonte comparabile; per il tuo hardware, ollama run con l'opzione --verbose mostra la velocità reale.

#Verificare che un modello rientri nella memoria disponibile prima di adottarlo

  1. 01
    Leggere la dimensione riportata nel catalogo
    Apri la scheda del modello nel catalogo QuelLLM e annota il peso della quantizzazione desiderata.
  2. 02
    Aggiungere un margine
    Aggiungi circa 1 GB per il sistema e da 1 a 3 GB per la cache KV in base al contesto previsto. Il totale deve rimanere sotto i 12 GB.
  3. 03
    Avviare e misurare
    Carica il modello, poni una domanda, poi digita ollama ps: la colonna PROCESSOR deve mostrare 100 % GPU.
  4. 04
    Adattare se necessario
    Riduci il contesto, quantizza la cache KV o scendi di un livello di quantizzazione, in questo ordine.

#RAG locale su 12 GB: come distribuire la memoria

Un RAG locale riunisce tre componenti: un modello di embedding che indicizza i tuoi documenti, eventualmente un reranker che riordina i passaggi e il LLM che redige il testo. I primi due sono molto più piccoli del LLM e possono essere eseguiti, a scelta, sulla GPU o sul processore. Il budget si calcola sommando i tre componenti e mantenendo poi un margine per la cache KV: il contesto del LLM cresce con il numero di passaggi che gli invii.

Tre distribuzioni possibili
StrategiaPosizionamentoVantaggioLimite
Tutto sulla GPULLM 8B in Q5 (6 GB) + embedder + rerankerRisposte rapidePoco margine per un contesto lungo
Embedder sul processoreLLM 12B in Q4 (7 GB) su GPULibera spazio VRAM per il contestoIndicizzazione più lenta
Indicizzazione e poi spegnimentoEmbedder avviato solo durante l'indicizzazioneVRAM completamente libera successivamenteDue fasi da gestire

La seconda strategia è spesso la migliore: l'indicizzazione è un'attività in background che non richiede una GPU, mentre la generazione delle risposte sfrutta appieno la VRAM. Un embedder viene eseguito in background durante l'indicizzazione, poi entra in standby; sulla CPU, l'indicizzazione di una cartella di documenti richiede più tempo, ma viene effettuata una sola volta. Qui non indichiamo le dimensioni degli embedder; consulta le guide sugli embedding e sul RAG locale per i valori di ciascun modello.

#Cosa non permettono 12 GB

Modelli da 24 miliardi
Mistral Small 24B pesa 14 GB in Q4 secondo il catalogo: supera il limite. Per 24 miliardi di parametri, servono 16 GB.
Modelli densi da 27 a 32 miliardi
Qwen 3.8 27B e simili pesano 16 GB in Q4; mira a 24 GB.
MoE da 30 a 35 miliardi
Qwen 3.6 35B-A3B pesa 21 GB, GLM 4.7 Flash 19 GB e Qwen3-Coder 30B-A3B 19 GB: fuori portata su 12 GB, anche se leggono solo 3 miliardi di parametri attivi, perché tutto il modello deve risiedere in memoria.
Contesto lungo su un 14B
Un Qwen 3 14B in Q4 lascia circa 2 GB: non contare su decine di migliaia di token senza quantizzare la cache KV.

Ollama permette di quantizzare la cache KV per risparmiare spazio: secondo la sua documentazione, OLLAMA_KV_CACHE_TYPE=q8_0 utilizza circa la metà della memoria del formato f16 predefinito, a condizione che Flash Attention sia attiva. La guida sulla cache KV illustra nel dettaglio questa impostazione, e la finestra di contesto predefinita di Ollama, di 4 096 token, si può modificare con OLLAMA_CONTEXT_LENGTH.

Contesto di 16k e cache KV in q8_0 per un 14B
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=16384 ollama serve
ollama ps

#12 GB o 16 GB: la scelta giusta per te

Scegliere tra 12 e 16 GB
Il tuo bisogno12 GB bastano?Perché
Chat, traduzione, riassunto con un modello da 9B a 14BSìQ4 o Q5, con contesto
RAG leggero con embedder su processoreSìLLM da 7 a 9 GB su GPU
Modelli da 20 a 24 miliardi (gpt-oss 20B, Mistral Small 24B)NoPeso compreso tra 13 e 14 GB in Q4
Agenti di programmazione con contesto lungoNoContesto e pesi superano 12 GB
Budget contenuto, uso occasionaleSìIl surplus non offre alcun vantaggio se i modelli da 20 a 24 miliardi non ti servono

#Domande frequenti

Domande frequenti
Qual è il migliore LLM per 12 GB di VRAM?+
Un modello da 12 a 14 miliardi di parametri in Q4 o Q5, come Gemma 4 12B (7 GB in Q4), Mistral Nemo 12B o Qwen 3 14B (9 GB), secondo il catalogo QuelLLM. Questi modelli lasciano margine per il contesto. Un Qwen 3.5 9B in Q8 (10 GB) offre la massima precisione ottenibile da un 9B, con un contesto più breve.
12 GB di VRAM sono sufficienti nel 2026?+
Sì per la chat, la traduzione, il riassunto e un RAG leggero con modelli fino a 14 miliardi di parametri. No per i modelli da 20 a 24 miliardi, che pesano da 13 a 14 GB in Q4, né per quelli da 27 a 35 miliardi, che pesano tra 16 e 21 GB. Questi ultimi richiedono da 16 a 24 GB.
È possibile eseguire un 14B su 12 GB?+
Sì, in Q4: Qwen 3 14B pesa 9 GB secondo il catalogo, lasciando circa 2 GB per la cache KV e il sistema. Con la Q5 (11 GB) il margine è troppo ridotto; la Q8 (16 GB) è impossibile. Verifica con ollama ps che il modello sia al 100% sulla GPU.
12 GB o 16 GB per i LLM?+
Prendi 16 GB se vuoi i modelli da 20 a 24 miliardi di parametri, come gpt-oss 20B (13 GB) o Mistral Small 24B (14 GB), con un po' di contesto. Resta a 12 GB se ti bastano modelli da 9 a 14 miliardi. Confronta il prezzo per gigabyte nel monitoraggio del sito.
Quale scheda da 12 GB scegliere?+
Verifica prima la capacità: la RTX 3060 esiste nelle versioni da 12 e 8 GB, mentre la 4070 Ti Super ha 16 GB. Tra le schede da 12 GB, la RTX 3060 è la più economica, mentre la RTX 4070 e la 5070 sono le più veloci. Il prezzo del giorno si può consultare nel monitoraggio dei prezzi del sito.
I modelli MoE da 30 miliardi riescono a stare in 12 GB?+
No. Un modello MoE legge solo una parte dei suoi pesi per ogni token, ma deve essere caricato integralmente: Qwen3-Coder 30B-A3B pesa 19 GB e Qwen 3.6 35B-A3B 21 GB in Q4. Su 12 GB, una parte passerebbe alla CPU e la velocità diminuirebbe drasticamente.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.