Principiante 11 minRTX 30

Quale LLM su RTX 3060 8 GB ?

Risposta diretta

La RTX 3060 8 GB esegue modelli da 7 a 9 miliardi in Q4, come Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB), ma non quelli da 12B. La sua particolarità: un bus da 128 bit e 240 GB/s, contro 192 bit e 360 GB/s della 3060 12 GB, il che la rende nettamente più lenta nella generazione. La tabella pubblica di llama.cpp riporta 75,6 token/s per la 12 GB su un 7B.

Con il nome RTX 3060, NVIDIA ha venduto due schede: la versione originale da 12 GB e una versione da 8 GB arrivata alla fine del 2022, con un bus di memoria più stretto. Questa guida spiega cosa cambia per l'IA locale, quali modelli stanno nella memoria della versione da 8 GB, come distinguere le due versioni all'acquisto e quale velocità aspettarsi, precisando cosa è stato misurato e cosa no.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RTX 3060 8 GB: cosa cambia rispetto alla versione da 12 GB

La RTX 3060 da 8 GB fa girare i modelli da 7 a 9 miliardi di parametri in Q4: Granite 4.2 8B richiede 4,6 GB e Qwen 3.5 9B 6 GB secondo il catalogo QuelLLM. Gemma 4 12B (7 GB in Q4) non rientra comodamente nella memoria disponibile. La differenza rispetto alla 3060 da 12 GB è duplice: 4 GB in meno e un bus da 128 bit invece di 192. Secondo la stampa specializzata che ha riportato le specifiche al momento del lancio, il bus più stretto riduce la banda passante a 240 GB/s, cioè il 33% in meno rispetto ai 360 GB/s della versione da 12 GB. Per l'IA locale, questo conta: la generazione di testo dipende soprattutto dalla banda passante della memoria. Non esistono misurazioni pubbliche per la versione da 8 GB, ma si può stimare che generi circa 50 token al secondo su un modello da 7 miliardi di parametri in Q4_0, contro i 75,6 misurati sulla versione da 12 GB.

Chip
Lo stesso chip GA106 della 3060 da 12 GB e la stessa potenza della scheda da 170 W.
Memoria
8 GB di GDDR6 su un bus da 128 bit, ovvero 240 GB/s, contro 12 GB, 192 bit e 360 GB/s.
Conseguenza
Lo stesso numero di core di calcolo, ma capacità e larghezza di banda ridotte: è la memoria, non il calcolo, a limitare l'IA locale.

#Modelli compatibili con 8 GB

Modelli per una RTX 3060 8 GB (peso secondo il catalogo QuelLLM)
ModelloPesi in Q4Peso in Q8Su 8 GB
Qwen 3.5 4B2,3 GB4,3 GBQ8 possibile, ampio margine per il contesto
Granite 4.2 8B4,6 GB9 GBQ4 con un buon margine; il Q8 non entra in memoria
Qwen 3.5 9B6 GB10 GBQ4 con un contesto moderato
Gemma 4 12B7 GB13 GBNon entra in memoria con il contesto

La capacità è identica a quella di una 3070 o di una 3060 Ti, due schede da 8 GB più veloci. Si applicano le stesse regole: puntare a un massimo di 6 GB per i pesi, riservare un gigabyte per il driver e il contesto e verificare che il modello sia interamente contenuto nella scheda. A questo scopo, il comando ollama ps mostra 100% GPU quando tutto è caricato nella scheda. Se compare una percentuale di CPU, il modello non è interamente contenuto nella scheda e la velocità crolla.

#Velocità: perché il bus della memoria domina

La tabella collaborativa di llama.cpp (Llama 2 7B in Q4_0, file da 3,56 GiB) non include la 3060 da 8 GB, ma permette di capire quale differenza faccia il bus di memoria. Riporta 75,6 token al secondo per la 3060 da 12 GB (bus da 192 bit), 92,2 per la 3060 Ti da 8 GB (256 bit) e 63,9 per una RTX 4060 Ti da 8 GB il cui bus è di soli 128 bit. A parità di capacità, l'ordine segue la larghezza del bus, con qualche sfumatura: una scheda più recente con un bus stretto può risultare più lenta di una più vecchia con un bus largo.

Generazione su Llama 2 7B Q4_0: il bus fa la differenza
SchedaMemoriaBusGenerazione (tok/s)Stato
RTX 3060 Ti8 GB256 bit92,2Misura pubblicata
RTX 3060 12 GB12 GB192 bit75,6Misura pubblicata
RTX 4060 Ti 8 GB8 GB128 bit63,9Misura pubblicata
RTX 3060 8 GB8 GB128 bitcirca 47–50Stima, non misurata

La stima dell'ultima riga applica a 240 GB/s il rendimento misurato della versione da 12 GB, che raggiunge circa l'80% di quanto consentito dalla sua banda passante. È una proiezione, da presentare come tale. Applicando una proporzione alle dimensioni dei file, si ottengono circa 40 token al secondo per Granite 4.2 8B (4,6 GB) e una trentina per Qwen 3.5 9B (6 GB): limiti superiori teorici. Questa velocità consente comunque di leggere le risposte durante una conversazione, ma colloca la versione da 8 GB circa un terzo al di sotto di quella da 12 GB e oltre il 40% al di sotto della 3060 Ti.

#Trappole da evitare

Due schede con un solo nome
NVIDIA elenca la RTX 3060 con 12 GB o 8 GB e un bus da 192 o 128 bit. Il solo nome non dice nulla: esigi che la capacità sia specificata nell'annuncio.
Verifica all'installazione
Esegui nvidia-smi: la versione da 12 GB mostra circa 12.287 MiB secondo i dati di llama.cpp, la versione da 8 GB circa 7.800 MiB, come la vicina 3060 Ti.
Prezzo allineato alla versione 12 GB
Alcuni venditori indicano lo stesso prezzo per entrambe le versioni. Per il confronto, usa il monitoraggio settimanale del sito anziché un prezzo fissato una volta per tutte.
Aspettativa irrealistica sui 12B
Gemma 4 12B e i modelli di queste dimensioni non entrano in memoria con il contesto; il limite è di 9B in Q4.
Leggere il nome e la memoria totale della scheda
nvidia-smi --query-gpu=name,memory.total --format=csv

Il secondo controllo vale anche per un PC recuperato: la descrizione del produttore o il nome della scheda in Windows non consentono sempre di distinguere le versioni, mentre la memoria totale restituita da nvidia-smi non lascia dubbi.

#Il calcolo alla base della stima

Il principio è semplice: per produrre un token, la scheda rilegge la maggior parte dei pesi del modello. Il numero massimo di token al secondo è quindi dell'ordine della larghezza di banda divisa per la dimensione del file. Il file di test pesa 3,56 GiB, cioè circa 3,82 GB. Per la 3060 da 12 GB, 360 GB/s divisi per 3,82 danno un limite massimo di 94 token al secondo, e la misura pubblicata ne raggiunge l'80%. Per la versione da 8 GB, 240 GB/s danno un limite massimo di circa 63 token al secondo; applicando lo stesso rendimento, se ne ottengono una cinquantina.

Dal limite teorico alla stima
SchedaLarghezza di bandaLimite (GB/s ÷ 3,82 GB)Risultato
RTX 3060 12 GB360 GB/scirca 94 tok/s75,6 tok/s misurati (circa 80 %)
RTX 3060 8 GB240 GB/scirca 63 tok/scirca 50 tok/s stimati

Questo metodo ha un limite: l'efficienza varia da scheda a scheda, come mostrano altre schede della stessa tabella, il cui rapporto tra valore misurato e limite massimo va dal 67% all'85%. Considera quindi un intervallo, non un valore preciso. Nota anche che i risultati pubblicati dipendono dal driver, dal sistema e dal produttore della scheda, anche a parità di chip, ed effettua misurazioni sul tuo hardware se la velocità determina un acquisto.

#Come si comporta in pratica

Traduci la velocità di generazione in tempo di attesa. A circa 40 token al secondo, una risposta di 500 token, cioè una pagina di spiegazione, richiede una dozzina di secondi; su una 3060 da 12 GB, la stessa risposta ne richiederebbe circa otto, sempre secondo una stima teorica. Per una conversazione, la differenza è tollerabile: il testo appare più velocemente di quanto tu riesca a leggerlo. Diventa fastidiosa in due casi: gli agenti che concatenano numerose chiamate al modello e l'elaborazione in batch di numerosi documenti, dove la differenza si accumula.

La capacità di 8 GB pone una limitazione più chiara della velocità. Impone di scegliere tra un contesto lungo e un modello più grande, mentre una scheda da 12 GB lascia spazio a entrambi. Se il tuo uso si limita a porre domande brevi a un 8B, la versione 8 GB basta. Se vuoi collegare il modello ai tuoi documenti, meglio puntare a più memoria.

  1. 01
    Controlla l'annuncio
    Cerca l'indicazione 8 GB o 12 GB nel titolo, nella descrizione o nelle foto della confezione. Se non è specificata, chiedi questa informazione al venditore.
  2. 02
    Richiedere uno screenshot
    Esigi uno screenshot di nvidia-smi o dello strumento GPU-Z che mostri la memoria totale e la larghezza del bus.
  3. 03
    Testare al momento del ritiro
    Sul posto, esegui nvidia-smi: circa 12 287 MiB per la versione da 12 GB, intorno a 7 800 MiB per quella da 8 GB.
  4. 04
    Eseguire un modello
    Carica un modello 8B in Q4 con Ollama e verifica con ollama ps che sia al 100% sulla GPU prima di concludere l'acquisto.

#Contesto: sfruttare 8 GB

Con 8 GB, la cache del contesto è il vero limite. La documentazione di Ollama indica che la cache K/V può essere quantizzata quando Flash Attention è attiva: imposta OLLAMA_FLASH_ATTENTION=1 e poi OLLAMA_KV_CACHE_TYPE=q8_0 prima di avviare il server. Con un bus da 128 bit, la scheda fatica già sul piano della velocità; è quindi preferibile non aggiungere un contesto smisurato. Un contesto di qualche migliaio di token con un modello 8B in Q4 è un buon compromesso.

Linux: avviare Ollama con cache K/V quantizzata
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Cosa scegliere in alternativa

Alternative con budget simile
SchedaMemoriaGenerazione (tok/s)Cosa offre
RTX 3060 12 GB12 GB75,6 (misurazione)Permette di usare i modelli da 12B, più veloce della versione da 8 GB
RTX 3060 Ti8 GB92,2 (misurazione)Stessa capacità, ma molto più veloce
RTX 4060 Ti 8 GB8 GB63,9 (misurazione)Più recente, ma bus da 128 bit come la 3060 8 GB

La scelta dipende dalle tue esigenze: per la capacità, la 3060 12 GB; per la velocità sui modelli da 8 miliardi, la 3060 Ti. I prezzi dell’usato cambiano ogni settimana: il monitoraggio del sito rileva il prezzo più basso delle schede per l’IA locale.

#Verdetto 2026

Tienila se
È già presente nel vostro PC e state cercando un modello da 8 o 9B in Q4 per chat o aiuto al codice, senza richieste di velocità.
Non comprare per l'IA
Una 3060 da 12 GB offre di più, a un prezzo spesso simile. Acquista la versione da 8 GB solo a un prezzo nettamente inferiore.
Verifica sempre la versione
Esigi che la quantità di memoria sia indicata nell'annuncio e verifica con nvidia-smi alla ricezione.

#Domande frequenti

Domande frequenti
Come distinguere la RTX 3060 8 GB dalla 12 GB?+
Verifica l'indicazione della memoria sulla confezione o nell'annuncio, poi esegui nvidia-smi: la memoria totale è vicina a 12 000 MiB per la versione da 12 GB (12 287 MiB rilevati da llama.cpp) e a 8 000 MiB per quella da 8 GB. NVIDIA distingue anche i bus: 192 bit per la versione da 12 GB, 128 bit per quella da 8 GB.
Quanti token al secondo su una RTX 3060 8 GB?+
Non esistono misurazioni pubbliche. La versione da 12 GB genera 75,6 token al secondo su un modello 7B in Q4_0 secondo la tabella di llama.cpp; con 240 GB/s invece di 360, la versione da 8 GB dovrebbe raggiungere circa 47-50 token al secondo nello stesso test, secondo una stima teorica.
RTX 3060 8 GB o RTX 4060 8 GB per un LLM?+
Entrambe hanno 8 GB e un bus da 128 bit. La RTX 4060 Ti da 8 GB, un'altra scheda con bus da 128 bit, registra 63,9 token al secondo nella tabella pubblica di llama.cpp. Scegli in base al prezzo e al consumo: a parità di capacità e bus, la velocità sarà dello stesso ordine.
La RTX 3060 8 GB può eseguire Gemma 4 12B?+
Difficilmente. Il catalogo indica 7 GB per i pesi in Q4, lasciando appena un gigabyte per il contesto e il sistema. Il modello viene quindi distribuito tra la scheda e la RAM, come segnala ollama ps, e la velocità cala drasticamente. Preferisci Qwen 3.5 9B (6 GB) o Granite 4.2 8B (4,6 GB).
Ollama funziona su una RTX 3060 8 GB?+
Sì. Ollama elenca la RTX 3060 tra le schede con capacità di calcolo 8.6 e richiede un driver 550 o successivo. Dopo il primo caricamento, controlla con ollama ps che compaia la dicitura 100% GPU: è il segno che il modello rientra interamente negli 8 GB.
È meglio una RTX 3060 da 12 GB?+
Per l'IA locale, sì in quasi tutti i casi: nella tabella pubblica di llama.cpp registra 75,6 token al secondo, dispone di 4 GB in più e permette di caricare modelli da 12 miliardi. La versione da 8 GB ha senso solo se è già installata o costa nettamente meno.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.