Principiante 11 minRTX 30

Quale LLM su RTX 3060 Ti (8 GB) ?

Risposta diretta

La RTX 3060 Ti (8 GB, 448 GB/s) fa girare senza superare la memoria disponibile modelli da 7 a 9 miliardi in Q4, come Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB). Genera 92 token/s sul test di riferimento di llama.cpp, più velocemente di una RTX 3060 da 12 GB (75,6), ma i suoi 8 GB la escludono dai modelli da 12 miliardi. Per l'IA locale, la sua velocità non compensa i 4 GB mancanti.

La RTX 3060 Ti (dicembre 2020) è nettamente più veloce nei giochi della RTX 3060, ma ha solo 8 GB di memoria. Questa guida si basa su misurazioni pubbliche recenti per dire cosa esegue, cosa offre Flash Attention, in che modo si differenzia dalla 3060 da 12 GB e in quali casi vale la pena passare a qualcosa di diverso.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 3060 Ti vs RTX 3060: il riassunto per l'IA locale

La RTX 3060 Ti è più veloce della 3060 12 GB nella generazione di testo, ma ha 4 GB in meno, e per l'IA locale è la capacità a costituire il limite. La tabella collaborativa di llama.cpp riporta 92,2 token al secondo per la 3060 Ti, contro 75,6 per la 3060 12 GB, su un modello da 7 miliardi di parametri in Q4_0: circa il 22% in più. Questo vantaggio deriva dal suo bus da 256 bit, che offre 448 GB/s di larghezza di banda contro 360 GB/s. Tuttavia, con 8 GB riesce a eseguire modelli da 7 a 9 miliardi di parametri (Granite 4.2 8B da 4,6 GB, Qwen 3.5 9B da 6 GB), ma non Gemma 4 12B (7 GB di pesi), che non lascia alcun margine per il contesto. Se punti a un modello 8B, la Ti è la più veloce delle due; se punti a un 12B, è fuori gioco.

RTX 3060 Ti
Chip GA104, dicembre 2020, 4 864 core CUDA, 8 GB di GDDR6, bus a 256 bit, 448 GB/s.
RTX 3060
Chip GA106, 3.584 core, 12 GB di GDDR6 su bus da 192 bit, 360 GB/s.
Per un LLM
Più banda passante significa più velocità; meno memoria significa meno modelli. I due effetti si compensano, ma la capacità pesa di più.

#Modelli compatibili con 8 GB

Modelli per una RTX 3060 Ti (peso secondo il catalogo QuelLLM)
ModelloPesi in Q4Peso in Q8Su 8 GB
Granite 4.2 8B4,6 GB9 GBQ4 ci sta comodamente; Q8 non entra in memoria
Qwen 3.5 9B6 GB10 GBQ4 con contesto moderato
Gemma 4 12B7 GB13 GBNon entra in memoria con il contesto

La velocità di generazione della scheda non sarà il fattore limitante: lo sarà la memoria disponibile. Il test di llama.cpp rileva 7 838 MiB di memoria sulla 3060 Ti, un po' meno degli 8 192 MiB nominali, e questa memoria si divide tra i pesi, la cache di contesto e la gestione dell'immagine a schermo, se è collegato un monitor. Prevedi al massimo 6 GB di pesi per mantenere un contesto di diverse migliaia di token.

#Installazione e configurazione

Nell'elenco di Ollama, la scheda ha una compute capability di 8.6; Ollama richiede un driver 550 o più recente. Per l'alimentazione, la scheda tecnica NVIDIA indica 200 W per la scheda grafica e consiglia un alimentatore di sistema da 600 W, contro i 550 W consigliati per la 3060: un alimentatore da 500 W, talvolta citato, è al di sotto di questa raccomandazione.

  1. 01
    Installare il driver
    Installa un driver NVIDIA 550 o successivo e controlla con nvidia-smi che la scheda sia riconosciuta con circa 8 GB di memoria.
  2. 02
    Installare Ollama
    Segui la guida di installazione, poi avvia un modello da 8 miliardi in Q4 con ollama run.
  3. 03
    Attivare le impostazioni della memoria
    Avvia il server con OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0. La documentazione specifica che la cache K/V può essere quantizzata quando Flash Attention è attivata.
  4. 04
    Monitorare la memoria
    Durante una lunga conversazione, controlla nvidia-smi: se la memoria si avvicina ai 7 800 MiB, riduci il contesto.
Linux: avviare Ollama con le impostazioni di memoria
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Velocità: generazione, lettura del prompt e Flash Attention

Una misurazione di settembre 2026 pubblicata nella tabella di llama.cpp permette di descrivere nel dettaglio il comportamento della 3060 Ti, con un modello da 7 miliardi di parametri in Q4_0 da 3,56 GiB. La larghezza di banda di 448 GB/s consentirebbe un massimo di circa 117 token al secondo; la misurazione raggiunge 92 token, ovvero circa il 79% del limite. Il risultato più interessante riguarda Flash Attention.

RTX 3060 Ti, Llama 2 7B Q4_0, effetto di Flash Attention
MisurazioneSenza Flash AttentionCon Flash AttentionScarto
Generazione (128 token)92,2 tok/s96,5 tok/s+5 %
Lettura di un prompt di 4.096 token1 897 tok/s2 598 tok/s+37 %

La generazione guadagna poco, ma la lettura di un prompt lungo migliora di più di un terzo, il che conta per il RAG e i riassunti dei documenti. A questo ritmo, un prompt di 10.000 token viene letto in circa quattro secondi, un calcolo teorico che presuppone una velocità di elaborazione costante. Ollama attiva automaticamente Flash Attention quando la scheda lo permette; puoi forzarne l'attivazione con la variabile OLLAMA_FLASH_ATTENTION=1.

Per un modello più pesante del file di test, una proporzione fornisce ordini di grandezza: 92 × 3,82 ÷ 4,6, cioè circa 76 token al secondo per Granite 4.2 8B in Q4, e circa 59 per Qwen 3.5 9B (6 GB). Sono limiti superiori teorici, non misure. Se vuoi confrontare la tua scheda con questi valori, lo strumento llama-bench di llama.cpp riproduce il test: stesso file Llama 2 7B in Q4_0, tutti i livelli caricati sulla GPU, con e senza Flash Attention. I risultati variano in base al driver, al sistema e al produttore della scheda, anche a parità di chip, quindi uno scarto di qualche punto percentuale non ha nulla di anomalo. Queste velocità superano il ritmo di lettura: la scheda non è mai il fattore limitante durante una conversazione.

#Documenti e RAG: dove si impiega il tempo

Quando interroghi i tuoi documenti, la scheda impiega prima del tempo a leggere il prompt, poi a generare la risposta. Sulla 3060 Ti, un prompt di 4.096 token, cioè una decina di pagine, viene letto in circa 2,2 secondi senza Flash Attention e in 1,6 secondi con Flash Attention, secondo le velocità misurate da llama.cpp. La risposta di 400 token richiede poi all'incirca quattro o cinque secondi a 92 token al secondo sul modello di test, di più su un 8B attuale. Sono calcoli teorici che presuppongono velocità costanti, ma mostrano che l'attesa rimane di pochi secondi.

Il limite del RAG su 8 GB non è quindi il tempo, ma la memoria: un contesto di diverse decine di migliaia di token satura la cache di contesto di un modello da 8 miliardi. Due modi per restare entro il budget di memoria: ridurre il numero di estratti inseriti nel prompt e quantizzare la cache K/V in q8_0, che utilizza circa la metà della memoria del formato predefinito secondo la documentazione di Ollama.

#Quando passare a qualcosa di diverso

Cosa richiede ogni esigenza (peso secondo il catalogo QuelLLM)
Il tuo bisognoMemoria dei pesiScheda adatta
Un 8B in Q4 (Granite 4.2 8B)4,6 GB8 GB sono sufficienti
Un 9B in Q4 con contesto medio (Qwen 3.5 9B)6 GB8 GB, al limite per un uso confortevole
Un 8B in Q8 (Granite 4.2 8B)9 GB12 GB
Un 12B in Q4 (Gemma 4 12B)7 GB più il contesto12 GB
Un 12B in Q8 (Gemma 4 12B)13 GB16 GB

Leggi questa tabella dall'alto verso il basso: la 3060 Ti copre le prime due righe e le tre successive richiedono più memoria. Se le tue esigenze si collocano nella metà inferiore, cambiare scheda è giustificato; altrimenti, la 3060 Ti fa il suo lavoro. Un modello di qualità superiore ma più grande a volte vale più di una scheda più veloce: a 92 token al secondo, non sei limitato dalla velocità.

#3060 Ti e 3060 12 GB: gemelli solo in apparenza

3060 Ti o 3060 da 12 GB per un LLM
CriterioRTX 3060 TiRTX 3060 12 GB
Memoria8 GB12 GB
Bus / banda passante256 bit / 448 GB/s192 bit / 360 GB/s
Generazione (7B Q4_0)92,2 tok/s75,6 tok/s
Gemma 4 12B in Q4 (7 GB)Non entra in memoria con il contestoCi sta con margine
Alimentatore consigliato per il sistema600 W550 W

La prima reazione è scegliere la più veloce. Tuttavia, sui modelli da 8 a 9 miliardi che entrambe le schede riescono a caricare, il 22% di velocità in più non cambia l'esperienza: in entrambi i casi, il testo appare più velocemente di quanto si riesca a leggerlo. La 3060 12 GB, invece, permette di accedere a un'intera categoria di modelli. È quindi la scelta migliore per l'IA locale, a meno che il tuo utilizzo non resti definitivamente limitato ai modelli da 8 a 9B. Una precauzione al momento dell'acquisto: NVIDIA ha anche commercializzato una 3060 Ti con memoria GDDR6X, identificabile dalla scheda tecnica; la capacità rimane di 8 GB.

#3060 Ti e RTX 4060 Ti 8 GB

La RTX 4060 Ti da 8 GB, più recente, raggiunge 63,9 token al secondo nello stesso test, ovvero nettamente in meno rispetto alla 3060 Ti. La causa è il suo bus da 128 bit, che limita la banda passante nonostante un'architettura più efficiente. Per la generazione di testo, la 3060 Ti rimane quindi più veloce di questa scheda più recente, con capacità uguali. I suoi vantaggi sono altrove: le funzionalità più recenti dell'architettura e, secondo le schede dei produttori, un consumo più moderato, utile in un caso di cassa compatto o su una macchina che rimane accesa per servire un modello. Non si tratta comunque di un aumento di velocità nella generazione di testo, né di un aumento di memoria. Se esitiate tra le due, guardate la versione da 16 GB della 4060 Ti, che offre il doppio di memoria.

#Verdetto 2026

Tienila se
Funziona e usi modelli da 7 a 9 miliardi: velocità più che sufficiente, nessun guadagno da aspettarsi passando a una scheda con la stessa capacità.
Non comprarla per l'IA se puoi procurarti una scheda da 12 GB
Una 3060 da 12 GB permette di usare modelli da 12 miliardi di parametri. La differenza di prezzo sul mercato dell'usato varia ogni settimana: consulta il monitoraggio dei prezzi del sito.
Passa a 12 o 16 GB se
Vuoi un 12B, un contesto lungo o il RAG su documenti voluminosi.

#Domande frequenti

Domande frequenti
RTX 3060 Ti o RTX 3060 12 GB per un LLM?+
La 3060 da 12 GB per l'IA locale, nonostante la sua velocità inferiore: 75,6 token al secondo contro 92,2 per la Ti nel test di llama.cpp, ma 4 GB di memoria in più. Questi 4 GB permettono di usare modelli da 12 miliardi come Gemma 4 12B, che la 3060 Ti non può caricare insieme al contesto.
La RTX 3060 Ti può eseguire Gemma 4 12B?+
Non agevolmente. Il catalogo indica 7 GB per i pesi in Q4, mentre llama.cpp vede solo 7 838 MiB sulla scheda, prima ancora di considerare la cache del contesto e la memoria per la visualizzazione. Il modello non rientra più nella VRAM non appena la conversazione si allunga. Resta su Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB).
Quanti token al secondo su una RTX 3060 Ti?+
92,2 token al secondo in generazione e 96,5 con Flash Attention, su Llama 2 7B in Q4_0 secondo la tabella pubblica di llama.cpp. Un modello più pesante sarà più lento, all'incirca in proporzione alle sue dimensioni: considera circa 60–75 token al secondo per un modello 8B o 9B in Q4, come stima teorica.
La RTX 3060 Ti è migliore della RTX 4060 per un LLM?+
A parità di memoria, 8 GB, la 3060 Ti genera più velocemente: 92,2 token al secondo, contro 63,9 per la RTX 4060 Ti 8 GB, il cui bus è solo di 128 bit. La 4060 consuma meno e offre funzionalità più recenti, ma non rappresenta un aumento di velocità nella generazione di testo.
Quale alimentatore per una RTX 3060 Ti?+
NVIDIA dichiara 200 W per la scheda e consiglia un alimentatore di sistema da 600 W, contro i 550 W consigliati per la RTX 3060. Un alimentatore da 500 W è quindi al di sotto della raccomandazione del produttore: preferiscine uno da 600 W di buona qualità, soprattutto se il tuo processore consuma molto.
Val la pena usare Flash Attention su una RTX 3060 Ti?+
Sì, soprattutto per i prompt lunghi: la tabella di llama.cpp riporta una velocità di lettura di 4.096 token pari a 2.598 token al secondo con Flash Attention contro 1.897 senza, cioè il 37% in più. La generazione guadagna circa il 5%. Ollama l'attiva automaticamente quando la scheda lo permette.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.