Quale LLM su RTX 3060 8 GB ?
La RTX 3060 8 GB esegue modelli da 7 a 9 miliardi in Q4, come Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB), ma non quelli da 12B. La sua particolarità: un bus da 128 bit e 240 GB/s, contro 192 bit e 360 GB/s della 3060 12 GB, il che la rende nettamente più lenta nella generazione. La tabella pubblica di llama.cpp riporta 75,6 token/s per la 12 GB su un 7B.
Con il nome RTX 3060, NVIDIA ha venduto due schede: la versione originale da 12 GB e una versione da 8 GB arrivata alla fine del 2022, con un bus di memoria più stretto. Questa guida spiega cosa cambia per l'IA locale, quali modelli stanno nella memoria della versione da 8 GB, come distinguere le due versioni all'acquisto e quale velocità aspettarsi, precisando cosa è stato misurato e cosa no.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RTX 3060 8 GB: cosa cambia rispetto alla versione da 12 GB
La RTX 3060 da 8 GB fa girare i modelli da 7 a 9 miliardi di parametri in Q4: Granite 4.2 8B richiede 4,6 GB e Qwen 3.5 9B 6 GB secondo il catalogo QuelLLM. Gemma 4 12B (7 GB in Q4) non rientra comodamente nella memoria disponibile. La differenza rispetto alla 3060 da 12 GB è duplice: 4 GB in meno e un bus da 128 bit invece di 192. Secondo la stampa specializzata che ha riportato le specifiche al momento del lancio, il bus più stretto riduce la banda passante a 240 GB/s, cioè il 33% in meno rispetto ai 360 GB/s della versione da 12 GB. Per l'IA locale, questo conta: la generazione di testo dipende soprattutto dalla banda passante della memoria. Non esistono misurazioni pubbliche per la versione da 8 GB, ma si può stimare che generi circa 50 token al secondo su un modello da 7 miliardi di parametri in Q4_0, contro i 75,6 misurati sulla versione da 12 GB.
- Chip
- Lo stesso chip GA106 della 3060 da 12 GB e la stessa potenza della scheda da 170 W.
- Memoria
- 8 GB di GDDR6 su un bus da 128 bit, ovvero 240 GB/s, contro 12 GB, 192 bit e 360 GB/s.
- Conseguenza
- Lo stesso numero di core di calcolo, ma capacità e larghezza di banda ridotte: è la memoria, non il calcolo, a limitare l'IA locale.
#Modelli compatibili con 8 GB
| Modello | Pesi in Q4 | Peso in Q8 | Su 8 GB |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | 4,3 GB | Q8 possibile, ampio margine per il contesto |
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 con un buon margine; il Q8 non entra in memoria |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 con un contesto moderato |
| Gemma 4 12B | 7 GB | 13 GB | Non entra in memoria con il contesto |
La capacità è identica a quella di una 3070 o di una 3060 Ti, due schede da 8 GB più veloci. Si applicano le stesse regole: puntare a un massimo di 6 GB per i pesi, riservare un gigabyte per il driver e il contesto e verificare che il modello sia interamente contenuto nella scheda. A questo scopo, il comando ollama ps mostra 100% GPU quando tutto è caricato nella scheda. Se compare una percentuale di CPU, il modello non è interamente contenuto nella scheda e la velocità crolla.
#Velocità: perché il bus della memoria domina
La tabella collaborativa di llama.cpp (Llama 2 7B in Q4_0, file da 3,56 GiB) non include la 3060 da 8 GB, ma permette di capire quale differenza faccia il bus di memoria. Riporta 75,6 token al secondo per la 3060 da 12 GB (bus da 192 bit), 92,2 per la 3060 Ti da 8 GB (256 bit) e 63,9 per una RTX 4060 Ti da 8 GB il cui bus è di soli 128 bit. A parità di capacità, l'ordine segue la larghezza del bus, con qualche sfumatura: una scheda più recente con un bus stretto può risultare più lenta di una più vecchia con un bus largo.
| Scheda | Memoria | Bus | Generazione (tok/s) | Stato |
|---|---|---|---|---|
| RTX 3060 Ti | 8 GB | 256 bit | 92,2 | Misura pubblicata |
| RTX 3060 12 GB | 12 GB | 192 bit | 75,6 | Misura pubblicata |
| RTX 4060 Ti 8 GB | 8 GB | 128 bit | 63,9 | Misura pubblicata |
| RTX 3060 8 GB | 8 GB | 128 bit | circa 47–50 | Stima, non misurata |
La stima dell'ultima riga applica a 240 GB/s il rendimento misurato della versione da 12 GB, che raggiunge circa l'80% di quanto consentito dalla sua banda passante. È una proiezione, da presentare come tale. Applicando una proporzione alle dimensioni dei file, si ottengono circa 40 token al secondo per Granite 4.2 8B (4,6 GB) e una trentina per Qwen 3.5 9B (6 GB): limiti superiori teorici. Questa velocità consente comunque di leggere le risposte durante una conversazione, ma colloca la versione da 8 GB circa un terzo al di sotto di quella da 12 GB e oltre il 40% al di sotto della 3060 Ti.
#Trappole da evitare
- Due schede con un solo nome
- NVIDIA elenca la RTX 3060 con 12 GB o 8 GB e un bus da 192 o 128 bit. Il solo nome non dice nulla: esigi che la capacità sia specificata nell'annuncio.
- Verifica all'installazione
- Esegui nvidia-smi: la versione da 12 GB mostra circa 12.287 MiB secondo i dati di llama.cpp, la versione da 8 GB circa 7.800 MiB, come la vicina 3060 Ti.
- Prezzo allineato alla versione 12 GB
- Alcuni venditori indicano lo stesso prezzo per entrambe le versioni. Per il confronto, usa il monitoraggio settimanale del sito anziché un prezzo fissato una volta per tutte.
- Aspettativa irrealistica sui 12B
- Gemma 4 12B e i modelli di queste dimensioni non entrano in memoria con il contesto; il limite è di 9B in Q4.
Il secondo controllo vale anche per un PC recuperato: la descrizione del produttore o il nome della scheda in Windows non consentono sempre di distinguere le versioni, mentre la memoria totale restituita da nvidia-smi non lascia dubbi.
#Il calcolo alla base della stima
Il principio è semplice: per produrre un token, la scheda rilegge la maggior parte dei pesi del modello. Il numero massimo di token al secondo è quindi dell'ordine della larghezza di banda divisa per la dimensione del file. Il file di test pesa 3,56 GiB, cioè circa 3,82 GB. Per la 3060 da 12 GB, 360 GB/s divisi per 3,82 danno un limite massimo di 94 token al secondo, e la misura pubblicata ne raggiunge l'80%. Per la versione da 8 GB, 240 GB/s danno un limite massimo di circa 63 token al secondo; applicando lo stesso rendimento, se ne ottengono una cinquantina.
| Scheda | Larghezza di banda | Limite (GB/s ÷ 3,82 GB) | Risultato |
|---|---|---|---|
| RTX 3060 12 GB | 360 GB/s | circa 94 tok/s | 75,6 tok/s misurati (circa 80 %) |
| RTX 3060 8 GB | 240 GB/s | circa 63 tok/s | circa 50 tok/s stimati |
Questo metodo ha un limite: l'efficienza varia da scheda a scheda, come mostrano altre schede della stessa tabella, il cui rapporto tra valore misurato e limite massimo va dal 67% all'85%. Considera quindi un intervallo, non un valore preciso. Nota anche che i risultati pubblicati dipendono dal driver, dal sistema e dal produttore della scheda, anche a parità di chip, ed effettua misurazioni sul tuo hardware se la velocità determina un acquisto.
#Come si comporta in pratica
Traduci la velocità di generazione in tempo di attesa. A circa 40 token al secondo, una risposta di 500 token, cioè una pagina di spiegazione, richiede una dozzina di secondi; su una 3060 da 12 GB, la stessa risposta ne richiederebbe circa otto, sempre secondo una stima teorica. Per una conversazione, la differenza è tollerabile: il testo appare più velocemente di quanto tu riesca a leggerlo. Diventa fastidiosa in due casi: gli agenti che concatenano numerose chiamate al modello e l'elaborazione in batch di numerosi documenti, dove la differenza si accumula.
La capacità di 8 GB pone una limitazione più chiara della velocità. Impone di scegliere tra un contesto lungo e un modello più grande, mentre una scheda da 12 GB lascia spazio a entrambi. Se il tuo uso si limita a porre domande brevi a un 8B, la versione 8 GB basta. Se vuoi collegare il modello ai tuoi documenti, meglio puntare a più memoria.
- 01Controlla l'annuncioCerca l'indicazione 8 GB o 12 GB nel titolo, nella descrizione o nelle foto della confezione. Se non è specificata, chiedi questa informazione al venditore.
- 02Richiedere uno screenshotEsigi uno screenshot di nvidia-smi o dello strumento GPU-Z che mostri la memoria totale e la larghezza del bus.
- 03Testare al momento del ritiroSul posto, esegui nvidia-smi: circa 12 287 MiB per la versione da 12 GB, intorno a 7 800 MiB per quella da 8 GB.
- 04Eseguire un modelloCarica un modello 8B in Q4 con Ollama e verifica con ollama ps che sia al 100% sulla GPU prima di concludere l'acquisto.
#Contesto: sfruttare 8 GB
Con 8 GB, la cache del contesto è il vero limite. La documentazione di Ollama indica che la cache K/V può essere quantizzata quando Flash Attention è attiva: imposta OLLAMA_FLASH_ATTENTION=1 e poi OLLAMA_KV_CACHE_TYPE=q8_0 prima di avviare il server. Con un bus da 128 bit, la scheda fatica già sul piano della velocità; è quindi preferibile non aggiungere un contesto smisurato. Un contesto di qualche migliaio di token con un modello 8B in Q4 è un buon compromesso.
#Cosa scegliere in alternativa
| Scheda | Memoria | Generazione (tok/s) | Cosa offre |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 (misurazione) | Permette di usare i modelli da 12B, più veloce della versione da 8 GB |
| RTX 3060 Ti | 8 GB | 92,2 (misurazione) | Stessa capacità, ma molto più veloce |
| RTX 4060 Ti 8 GB | 8 GB | 63,9 (misurazione) | Più recente, ma bus da 128 bit come la 3060 8 GB |
La scelta dipende dalle tue esigenze: per la capacità, la 3060 12 GB; per la velocità sui modelli da 8 miliardi, la 3060 Ti. I prezzi dell’usato cambiano ogni settimana: il monitoraggio del sito rileva il prezzo più basso delle schede per l’IA locale.
- Prezzi delle schede grafiche per l'IA locale (aggiornamento settimanale)
- Quale LLM su RTX 3060 12 GB?
- Quale LLM su RTX 3060 Ti (8 GB)?
#Verdetto 2026
- Tienila se
- È già presente nel vostro PC e state cercando un modello da 8 o 9B in Q4 per chat o aiuto al codice, senza richieste di velocità.
- Non comprare per l'IA
- Una 3060 da 12 GB offre di più, a un prezzo spesso simile. Acquista la versione da 8 GB solo a un prezzo nettamente inferiore.
- Verifica sempre la versione
- Esigi che la quantità di memoria sia indicata nell'annuncio e verifica con nvidia-smi alla ricezione.
#Domande frequenti
Come distinguere la RTX 3060 8 GB dalla 12 GB?+
Quanti token al secondo su una RTX 3060 8 GB?+
RTX 3060 8 GB o RTX 4060 8 GB per un LLM?+
La RTX 3060 8 GB può eseguire Gemma 4 12B?+
Ollama funziona su una RTX 3060 8 GB?+
È meglio una RTX 3060 da 12 GB?+
- Fonte: tabella delle prestazioni di llama.cpp su CUDA
- Fonte: scheda NVIDIA della RTX 3060
- Fonte: Tom's Hardware, RTX 3060 8 GB
- Fonte: FAQ Ollama (ollama ps, cache K/V)
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.