Quale LLM per 12 GB di VRAM ?
Con 12 GB di VRAM, scegli un modello da 12 a 14 miliardi di parametri in Q4 (Gemma 4 12B: 7 GB, Qwen 3 14B: 9 GB) o un modello 9B in Q8 (10 GB), con un margine da 1 a 3 GB per il contesto. I modelli da 20 a 24 miliardi richiedono 16 GB, quelli da 27 a 35 miliardi 24 GB.
Dodici gigabyte di VRAM permettono di eseguire modelli da 12 a 14 miliardi di parametri lasciando un margine. Questa guida indica quali modelli rientrano nella memoria disponibile, quali schede hanno davvero 12 GB, come ripartire la memoria per un RAG locale e quando passare a 16 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Per passare a 16 GB di VRAM: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#12 GB di VRAM: la soglia a cui diventano possibili i modelli da 14 miliardi di parametri
Con 12 GB di VRAM, puoi eseguire modelli da 12 a 14 miliardi di parametri in Q4 con un margine vero per il contesto, oppure un 9B in Q8. Secondo il catalogo QuelLLM, un Gemma 4 12B in Q4 pesa 7 GB, un Qwen 3 14B in Q4 pesa 9 GB, un Qwen 3.5 9B in Q8 pesa 10 GB. Il livello di 12 GB è quello in cui si abbandona la categoria dei modelli da 8 a 9 miliardi, più limitati in ragionamento e qualità di scrittura, senza ancora raggiungere i 24 miliardi, che richiedono 16 GB. Quelli che rimangono fuori portata sono i modelli da 27 a 35 miliardi di parametri, da 16 a 21 GB in Q4.
| Modello | Q4 | Q5 | Q8 | Su 12 GB |
|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 7 GB | 10 GB | Q8 possibile, contesto breve |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | Q4 o Q5; Q8 supera la memoria disponibile |
| Mistral Nemo 12B | 7 GB | 9 GB | 13 GB | Q4 o Q5; Q8 supera la memoria disponibile |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | Q4 con margine, Q5 al limite |
| Mistral Small 24B | 14 GB | 17 GB | 26 GB | No |
Come leggere questa tabella: aggiungi al peso la cache KV e circa un gigabyte di margine. Un Qwen 3 14B in Q4 (9 GB) lascia così circa 2 GB per il contesto; un Qwen 3.5 9B in Q8 (10 GB) ne lascia solo uno, il che limita il contesto. Prima di procedere, una correzione: una versione precedente di questa guida indicava che il 9B in Q8 si poteva eseguire comodamente su 12 GB; il catalogo indica 10 GB di peso, quindi il margine è stretto.
#Schede da 12 GB: quelle che li hanno davvero
Molte famiglie di schede hanno versioni con capacità diverse; il nome da solo non basta. NVIDIA indica, per la sua famiglia RTX 4070, 16 GB per la 4070 Ti Super e 12 GB per le 4070 Ti, 4070 Super e 4070. La RTX 5070 offre 12 GB di GDDR7 su un bus da 192 bit, mentre la 5070 Ti ne ha 16. La RTX 3060 esiste nelle versioni da 12 GB e da 8 GB; quella da 12 GB è la più interessante per l'IA locale. Sul versante AMD, la guida alla RX 7700 XT la colloca in questa fascia.
| Scheda | Capacità | Guide |
|---|---|---|
| RTX 3060 (versione 12 GB) | 12 GB GDDR6 | LLM su RTX 3060 12 GB |
| RTX 4070, 4070 Super, 4070 Ti | 12 GB GDDR6X o GDDR6 | LLM su RTX 4070 |
| RTX 5070 | 12 GB GDDR7, 192 bit | LLM su RTX 5070 |
| RX 7700 XT | 12 GB (vedi la guida) | LLM su RX 7700 XT |
Per confrontare, la capacità è il criterio principale e la banda passante il secondo: a parità di capacità, più veloce è la memoria, più fluida è la generazione. I prezzi cambiano ogni settimana; il monitoraggio dei prezzi del sito fornisce il costo per gigabyte di VRAM delle schede da 12 GB e 16 GB, permettendo di capire se la fascia superiore vale il sovrapprezzo.
#Quali modelli scegliere su 12 GB in base all'uso
| Uso | Modello e quantizzazione | Dimensione del modello | Cosa sapere |
|---|---|---|---|
| Discussione generale in francese | Mistral Nemo 12B Q5 | 9 GB | Contrassegnato come francese nel catalogo; 3 GB di margine |
| Ragionamento e scrittura | Qwen 3 14B Q4 | 9 GB | Circa 2 GB per il contesto |
| Multimodale (immagini) | Gemma 4 12B Q4 | 7 GB | Il modulo immagine consuma memoria in più |
| Qualità massima di un 9B | Qwen 3.5 9B Q8 | 10 GB | Contesto limitato a qualche migliaio di token |
| Velocità e leggerezza | Granite 4.2 8B Q5 | 6 GB | Lascia 5 GB per un embedder o un contesto lungo |
Per il codice, i modelli specializzati più potenti del catalogo superano i 12 GB: Devstral Small 2 24B pesa 14 GB in Q4 e Qwen3-Coder 30B-A3B 19 GB. Su 12 GB, rimani su un generico da 12 a 14 miliardi o su Qwen 2.5 Coder 14B, il cui catalogo offre 9 GB in Q4. Questi modelli si confrontano con quelli da 8 e 16 GB nei guide vicini.
#Velocità: il calcolo da fare da soli
Con 12 GB come con altre capacità, la velocità di generazione è limitata dalla larghezza di banda della memoria della scheda divisa per la dimensione dei pesi letti a ogni token. Ogni produttore pubblica questo valore nella scheda tecnica della scheda, in GB/s. Basta dividerlo per il peso del modello per ottenere un limite teorico, che la velocità reale non raggiunge mai del tutto. La tabella riporta questo limite per 100 GB/s di larghezza di banda; moltiplica per il valore della tua scheda.
| Modello in Q4 | Pesi letti | Limite massimo per ogni 100 GB/s | Esempio per 300 GB/s |
|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | ≈ 22 token/s | ≈ 65 token/s |
| Gemma 4 12B | 7 GB | ≈ 14 token/s | ≈ 43 token/s |
| Qwen 3 14B | 9 GB | ≈ 11 token/s | ≈ 33 token/s |
| Qwen 3.5 9B in Q8 | 10 GB | 10 token/s | 30 token/s |
Questo limite spiega perché una quantizzazione più fine rallenta: passare da Q4 a Q8 quasi raddoppia la quantità di dati letti per i pesi. Spiega anche perché due schede con la stessa capacità possono differire: il bus di memoria conta. NVIDIA indica 192 bit per la RTX 5070 da 12 GB e 256 bit per la 5070 Ti da 16 GB. Non pubblichiamo valori di token al secondo per ciascuna scheda, perché manca una fonte comparabile; per il tuo hardware, ollama run con l'opzione --verbose mostra la velocità reale.
#Verificare che un modello rientri nella memoria disponibile prima di adottarlo
- 01Leggere la dimensione riportata nel catalogoApri la scheda del modello nel catalogo QuelLLM e annota il peso della quantizzazione desiderata.
- 02Aggiungere un margineAggiungi circa 1 GB per il sistema e da 1 a 3 GB per la cache KV in base al contesto previsto. Il totale deve rimanere sotto i 12 GB.
- 03Avviare e misurareCarica il modello, poni una domanda, poi digita ollama ps: la colonna PROCESSOR deve mostrare 100 % GPU.
- 04Adattare se necessarioRiduci il contesto, quantizza la cache KV o scendi di un livello di quantizzazione, in questo ordine.
#RAG locale su 12 GB: come distribuire la memoria
Un RAG locale riunisce tre componenti: un modello di embedding che indicizza i tuoi documenti, eventualmente un reranker che riordina i passaggi e il LLM che redige il testo. I primi due sono molto più piccoli del LLM e possono essere eseguiti, a scelta, sulla GPU o sul processore. Il budget si calcola sommando i tre componenti e mantenendo poi un margine per la cache KV: il contesto del LLM cresce con il numero di passaggi che gli invii.
| Strategia | Posizionamento | Vantaggio | Limite |
|---|---|---|---|
| Tutto sulla GPU | LLM 8B in Q5 (6 GB) + embedder + reranker | Risposte rapide | Poco margine per un contesto lungo |
| Embedder sul processore | LLM 12B in Q4 (7 GB) su GPU | Libera spazio VRAM per il contesto | Indicizzazione più lenta |
| Indicizzazione e poi spegnimento | Embedder avviato solo durante l'indicizzazione | VRAM completamente libera successivamente | Due fasi da gestire |
La seconda strategia è spesso la migliore: l'indicizzazione è un'attività in background che non richiede una GPU, mentre la generazione delle risposte sfrutta appieno la VRAM. Un embedder viene eseguito in background durante l'indicizzazione, poi entra in standby; sulla CPU, l'indicizzazione di una cartella di documenti richiede più tempo, ma viene effettuata una sola volta. Qui non indichiamo le dimensioni degli embedder; consulta le guide sugli embedding e sul RAG locale per i valori di ciascun modello.
#Cosa non permettono 12 GB
- Modelli da 24 miliardi
- Mistral Small 24B pesa 14 GB in Q4 secondo il catalogo: supera il limite. Per 24 miliardi di parametri, servono 16 GB.
- Modelli densi da 27 a 32 miliardi
- Qwen 3.8 27B e simili pesano 16 GB in Q4; mira a 24 GB.
- MoE da 30 a 35 miliardi
- Qwen 3.6 35B-A3B pesa 21 GB, GLM 4.7 Flash 19 GB e Qwen3-Coder 30B-A3B 19 GB: fuori portata su 12 GB, anche se leggono solo 3 miliardi di parametri attivi, perché tutto il modello deve risiedere in memoria.
- Contesto lungo su un 14B
- Un Qwen 3 14B in Q4 lascia circa 2 GB: non contare su decine di migliaia di token senza quantizzare la cache KV.
Ollama permette di quantizzare la cache KV per risparmiare spazio: secondo la sua documentazione, OLLAMA_KV_CACHE_TYPE=q8_0 utilizza circa la metà della memoria del formato f16 predefinito, a condizione che Flash Attention sia attiva. La guida sulla cache KV illustra nel dettaglio questa impostazione, e la finestra di contesto predefinita di Ollama, di 4 096 token, si può modificare con OLLAMA_CONTEXT_LENGTH.
#12 GB o 16 GB: la scelta giusta per te
| Il tuo bisogno | 12 GB bastano? | Perché |
|---|---|---|
| Chat, traduzione, riassunto con un modello da 9B a 14B | Sì | Q4 o Q5, con contesto |
| RAG leggero con embedder su processore | Sì | LLM da 7 a 9 GB su GPU |
| Modelli da 20 a 24 miliardi (gpt-oss 20B, Mistral Small 24B) | No | Peso compreso tra 13 e 14 GB in Q4 |
| Agenti di programmazione con contesto lungo | No | Contesto e pesi superano 12 GB |
| Budget contenuto, uso occasionale | Sì | Il surplus non offre alcun vantaggio se i modelli da 20 a 24 miliardi non ti servono |
- Quale LLM per 16 GB di VRAM
- Quale LLM per 8 GB di VRAM
- LLM su RTX 3060 12 GB
- Quantizzare la cache KV per risparmiare VRAM
- RAG locale: introduzione
- Prezzi delle schede grafiche per l'IA locale
- Fonte: FAQ di Ollama (contesto, cache KV)
- Fonte: scheda NVIDIA della famiglia RTX 4070
- Fonte: scheda NVIDIA della famiglia RTX 5070
- Catalogo QuelLLM dei modelli (dimensioni in VRAM)
#Domande frequenti
Qual è il migliore LLM per 12 GB di VRAM?+
12 GB di VRAM sono sufficienti nel 2026?+
È possibile eseguire un 14B su 12 GB?+
12 GB o 16 GB per i LLM?+
Quale scheda da 12 GB scegliere?+
I modelli MoE da 30 miliardi riescono a stare in 12 GB?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.