Quale LLM su RTX 3060 Ti (8 GB) ?
La RTX 3060 Ti (8 GB, 448 GB/s) fa girare senza superare la memoria disponibile modelli da 7 a 9 miliardi in Q4, come Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB). Genera 92 token/s sul test di riferimento di llama.cpp, più velocemente di una RTX 3060 da 12 GB (75,6), ma i suoi 8 GB la escludono dai modelli da 12 miliardi. Per l'IA locale, la sua velocità non compensa i 4 GB mancanti.
La RTX 3060 Ti (dicembre 2020) è nettamente più veloce nei giochi della RTX 3060, ma ha solo 8 GB di memoria. Questa guida si basa su misurazioni pubbliche recenti per dire cosa esegue, cosa offre Flash Attention, in che modo si differenzia dalla 3060 da 12 GB e in quali casi vale la pena passare a qualcosa di diverso.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 3060 Ti vs RTX 3060: il riassunto per l'IA locale
La RTX 3060 Ti è più veloce della 3060 12 GB nella generazione di testo, ma ha 4 GB in meno, e per l'IA locale è la capacità a costituire il limite. La tabella collaborativa di llama.cpp riporta 92,2 token al secondo per la 3060 Ti, contro 75,6 per la 3060 12 GB, su un modello da 7 miliardi di parametri in Q4_0: circa il 22% in più. Questo vantaggio deriva dal suo bus da 256 bit, che offre 448 GB/s di larghezza di banda contro 360 GB/s. Tuttavia, con 8 GB riesce a eseguire modelli da 7 a 9 miliardi di parametri (Granite 4.2 8B da 4,6 GB, Qwen 3.5 9B da 6 GB), ma non Gemma 4 12B (7 GB di pesi), che non lascia alcun margine per il contesto. Se punti a un modello 8B, la Ti è la più veloce delle due; se punti a un 12B, è fuori gioco.
- RTX 3060 Ti
- Chip GA104, dicembre 2020, 4 864 core CUDA, 8 GB di GDDR6, bus a 256 bit, 448 GB/s.
- RTX 3060
- Chip GA106, 3.584 core, 12 GB di GDDR6 su bus da 192 bit, 360 GB/s.
- Per un LLM
- Più banda passante significa più velocità; meno memoria significa meno modelli. I due effetti si compensano, ma la capacità pesa di più.
#Modelli compatibili con 8 GB
| Modello | Pesi in Q4 | Peso in Q8 | Su 8 GB |
|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 ci sta comodamente; Q8 non entra in memoria |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 con contesto moderato |
| Gemma 4 12B | 7 GB | 13 GB | Non entra in memoria con il contesto |
La velocità di generazione della scheda non sarà il fattore limitante: lo sarà la memoria disponibile. Il test di llama.cpp rileva 7 838 MiB di memoria sulla 3060 Ti, un po' meno degli 8 192 MiB nominali, e questa memoria si divide tra i pesi, la cache di contesto e la gestione dell'immagine a schermo, se è collegato un monitor. Prevedi al massimo 6 GB di pesi per mantenere un contesto di diverse migliaia di token.
#Installazione e configurazione
Nell'elenco di Ollama, la scheda ha una compute capability di 8.6; Ollama richiede un driver 550 o più recente. Per l'alimentazione, la scheda tecnica NVIDIA indica 200 W per la scheda grafica e consiglia un alimentatore di sistema da 600 W, contro i 550 W consigliati per la 3060: un alimentatore da 500 W, talvolta citato, è al di sotto di questa raccomandazione.
- 01Installare il driverInstalla un driver NVIDIA 550 o successivo e controlla con nvidia-smi che la scheda sia riconosciuta con circa 8 GB di memoria.
- 02Installare OllamaSegui la guida di installazione, poi avvia un modello da 8 miliardi in Q4 con ollama run.
- 03Attivare le impostazioni della memoriaAvvia il server con OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0. La documentazione specifica che la cache K/V può essere quantizzata quando Flash Attention è attivata.
- 04Monitorare la memoriaDurante una lunga conversazione, controlla nvidia-smi: se la memoria si avvicina ai 7 800 MiB, riduci il contesto.
#Velocità: generazione, lettura del prompt e Flash Attention
Una misurazione di settembre 2026 pubblicata nella tabella di llama.cpp permette di descrivere nel dettaglio il comportamento della 3060 Ti, con un modello da 7 miliardi di parametri in Q4_0 da 3,56 GiB. La larghezza di banda di 448 GB/s consentirebbe un massimo di circa 117 token al secondo; la misurazione raggiunge 92 token, ovvero circa il 79% del limite. Il risultato più interessante riguarda Flash Attention.
| Misurazione | Senza Flash Attention | Con Flash Attention | Scarto |
|---|---|---|---|
| Generazione (128 token) | 92,2 tok/s | 96,5 tok/s | +5 % |
| Lettura di un prompt di 4.096 token | 1 897 tok/s | 2 598 tok/s | +37 % |
La generazione guadagna poco, ma la lettura di un prompt lungo migliora di più di un terzo, il che conta per il RAG e i riassunti dei documenti. A questo ritmo, un prompt di 10.000 token viene letto in circa quattro secondi, un calcolo teorico che presuppone una velocità di elaborazione costante. Ollama attiva automaticamente Flash Attention quando la scheda lo permette; puoi forzarne l'attivazione con la variabile OLLAMA_FLASH_ATTENTION=1.
Per un modello più pesante del file di test, una proporzione fornisce ordini di grandezza: 92 × 3,82 ÷ 4,6, cioè circa 76 token al secondo per Granite 4.2 8B in Q4, e circa 59 per Qwen 3.5 9B (6 GB). Sono limiti superiori teorici, non misure. Se vuoi confrontare la tua scheda con questi valori, lo strumento llama-bench di llama.cpp riproduce il test: stesso file Llama 2 7B in Q4_0, tutti i livelli caricati sulla GPU, con e senza Flash Attention. I risultati variano in base al driver, al sistema e al produttore della scheda, anche a parità di chip, quindi uno scarto di qualche punto percentuale non ha nulla di anomalo. Queste velocità superano il ritmo di lettura: la scheda non è mai il fattore limitante durante una conversazione.
#Documenti e RAG: dove si impiega il tempo
Quando interroghi i tuoi documenti, la scheda impiega prima del tempo a leggere il prompt, poi a generare la risposta. Sulla 3060 Ti, un prompt di 4.096 token, cioè una decina di pagine, viene letto in circa 2,2 secondi senza Flash Attention e in 1,6 secondi con Flash Attention, secondo le velocità misurate da llama.cpp. La risposta di 400 token richiede poi all'incirca quattro o cinque secondi a 92 token al secondo sul modello di test, di più su un 8B attuale. Sono calcoli teorici che presuppongono velocità costanti, ma mostrano che l'attesa rimane di pochi secondi.
Il limite del RAG su 8 GB non è quindi il tempo, ma la memoria: un contesto di diverse decine di migliaia di token satura la cache di contesto di un modello da 8 miliardi. Due modi per restare entro il budget di memoria: ridurre il numero di estratti inseriti nel prompt e quantizzare la cache K/V in q8_0, che utilizza circa la metà della memoria del formato predefinito secondo la documentazione di Ollama.
#Quando passare a qualcosa di diverso
| Il tuo bisogno | Memoria dei pesi | Scheda adatta |
|---|---|---|
| Un 8B in Q4 (Granite 4.2 8B) | 4,6 GB | 8 GB sono sufficienti |
| Un 9B in Q4 con contesto medio (Qwen 3.5 9B) | 6 GB | 8 GB, al limite per un uso confortevole |
| Un 8B in Q8 (Granite 4.2 8B) | 9 GB | 12 GB |
| Un 12B in Q4 (Gemma 4 12B) | 7 GB più il contesto | 12 GB |
| Un 12B in Q8 (Gemma 4 12B) | 13 GB | 16 GB |
Leggi questa tabella dall'alto verso il basso: la 3060 Ti copre le prime due righe e le tre successive richiedono più memoria. Se le tue esigenze si collocano nella metà inferiore, cambiare scheda è giustificato; altrimenti, la 3060 Ti fa il suo lavoro. Un modello di qualità superiore ma più grande a volte vale più di una scheda più veloce: a 92 token al secondo, non sei limitato dalla velocità.
#3060 Ti e 3060 12 GB: gemelli solo in apparenza
| Criterio | RTX 3060 Ti | RTX 3060 12 GB |
|---|---|---|
| Memoria | 8 GB | 12 GB |
| Bus / banda passante | 256 bit / 448 GB/s | 192 bit / 360 GB/s |
| Generazione (7B Q4_0) | 92,2 tok/s | 75,6 tok/s |
| Gemma 4 12B in Q4 (7 GB) | Non entra in memoria con il contesto | Ci sta con margine |
| Alimentatore consigliato per il sistema | 600 W | 550 W |
La prima reazione è scegliere la più veloce. Tuttavia, sui modelli da 8 a 9 miliardi che entrambe le schede riescono a caricare, il 22% di velocità in più non cambia l'esperienza: in entrambi i casi, il testo appare più velocemente di quanto si riesca a leggerlo. La 3060 12 GB, invece, permette di accedere a un'intera categoria di modelli. È quindi la scelta migliore per l'IA locale, a meno che il tuo utilizzo non resti definitivamente limitato ai modelli da 8 a 9B. Una precauzione al momento dell'acquisto: NVIDIA ha anche commercializzato una 3060 Ti con memoria GDDR6X, identificabile dalla scheda tecnica; la capacità rimane di 8 GB.
- Quale LLM su RTX 3060 12 GB?
- Prezzi delle schede grafiche per l'IA locale (aggiornamento settimanale)
#3060 Ti e RTX 4060 Ti 8 GB
La RTX 4060 Ti da 8 GB, più recente, raggiunge 63,9 token al secondo nello stesso test, ovvero nettamente in meno rispetto alla 3060 Ti. La causa è il suo bus da 128 bit, che limita la banda passante nonostante un'architettura più efficiente. Per la generazione di testo, la 3060 Ti rimane quindi più veloce di questa scheda più recente, con capacità uguali. I suoi vantaggi sono altrove: le funzionalità più recenti dell'architettura e, secondo le schede dei produttori, un consumo più moderato, utile in un caso di cassa compatto o su una macchina che rimane accesa per servire un modello. Non si tratta comunque di un aumento di velocità nella generazione di testo, né di un aumento di memoria. Se esitiate tra le due, guardate la versione da 16 GB della 4060 Ti, che offre il doppio di memoria.
#Verdetto 2026
- Tienila se
- Funziona e usi modelli da 7 a 9 miliardi: velocità più che sufficiente, nessun guadagno da aspettarsi passando a una scheda con la stessa capacità.
- Non comprarla per l'IA se puoi procurarti una scheda da 12 GB
- Una 3060 da 12 GB permette di usare modelli da 12 miliardi di parametri. La differenza di prezzo sul mercato dell'usato varia ogni settimana: consulta il monitoraggio dei prezzi del sito.
- Passa a 12 o 16 GB se
- Vuoi un 12B, un contesto lungo o il RAG su documenti voluminosi.
#Domande frequenti
RTX 3060 Ti o RTX 3060 12 GB per un LLM?+
La RTX 3060 Ti può eseguire Gemma 4 12B?+
Quanti token al secondo su una RTX 3060 Ti?+
La RTX 3060 Ti è migliore della RTX 4060 per un LLM?+
Quale alimentatore per una RTX 3060 Ti?+
Val la pena usare Flash Attention su una RTX 3060 Ti?+
- Fonte: tabella delle prestazioni di llama.cpp su CUDA
- Fonte: scheda NVIDIA della RTX 3060 e 3060 Ti
- Fonte: schede NVIDIA supportate da Ollama
- Fonte: FAQ Ollama (Flash Attention, cache K/V)
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.