Quale LLM su RTX 2060 / 2060 Super (6-8 GB) ?
Sì, una RTX 2060 può eseguire un LLM locale: con 6 GB, un modello da 3 a 4 miliardi di parametri in Q4 entra comodamente in memoria; con 8 GB (2060 Super), un modello da 8B in Q4 (da 4,6 a 5,2 GB) entra in memoria con un contesto moderato; la variante da 12 GB di fine 2021 può ospitare un modello da 14B. Lanciata nel gennaio 2019, la 2060 è ancora supportata da Ollama e CUDA. Il suo vero limite è la memoria, non l'età.
Esistono tre schede con questo nome: la RTX 2060 di gennaio 2019 (6 GB), la 2060 Super di luglio 2019 (8 GB) e una 2060 di dicembre 2021 con 12 GB. Per l'IA locale non sono affatto equivalenti. Questa pagina presenta le caratteristiche di ciascuna, cosa riesce a eseguire oggi, cosa indica il calcolo della velocità e quando passare ad altro.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RTX 2060, 2060 Super, 2060 12 GB: tre schede, tre usi
La RTX 2060 è stata lanciata il 15 gennaio 2019, la 2060 Super il 9 luglio 2019 e una variante della 2060 con 12 GB il 7 dicembre 2021, secondo la tabella delle GeForce serie 20 di Wikipedia. Tutte sono basate sul chip Turing TU106. Per un LLM, ciò che conta è la memoria (capacità, bus, larghezza di banda) piuttosto che i core CUDA.
| Scheda | Data di uscita | Core CUDA | Memoria | Larghezza di banda | Potenza |
|---|---|---|---|---|---|
| RTX 2060 | 15 gennaio 2019 | 1 920 | 6 GB, bus a 192 bit | 336 GB/s | 160 W |
| RTX 2060 Super | 9 luglio 2019 | 2 176 | 8 GB, bus 256 bit | 448 GB/s | 175 W |
| RTX 2060 12 GB | 7 dicembre 2021 | 2 176 | 12 GB | non specificata in questa tabella | 185 W |
La 2060 Super offre 448 GB/s di larghezza di banda contro i 336 GB/s della 2060 originale: a parità di modello, genera circa un terzo più velocemente. La variante da 12 GB è rara ed è arrivata più tardi, ma è di gran lunga la più interessante per l'IA locale: è l'unica delle tre che permette di caricare un 14B in Q4 (circa 9 GB) lasciando un margine di memoria. Verifica quindi la capacità esatta della scheda prima di qualsiasi acquisto: il nome da solo non la indica.
#Cosa può eseguire ogni variante
La regola è la stessa per qualsiasi scheda: i pesi in Q4 (riferimento del sito: 3B ≈ 2 GB, 7-8B ≈ 5 GB, 14B ≈ 9 GB) più la cache di contesto e circa 0,5 GB riservati dal sistema e dal motore. La tabella fornisce anche il limite teorico della velocità di generazione, dato dalla larghezza di banda divisa per la dimensione dei pesi. Non abbiamo misure della velocità di generazione su queste schede e non ne citiamo.
| Modello (Q4) | Dimensione del modello | 2060 6 GB (336 GB/s) | 2060 Super 8 GB (448 GB/s) | 2060 12 GB |
|---|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Sì, limite intorno a 280 t/s | Sì, circa 370 t/s | Sì |
| Qwen 3.5 4B | 2,3 GB | Sì, circa 146 t/s | Sì, circa 195 t/s | Sì |
| Granite 4.2 8B | 4,6 GB | Al limite, contesto molto breve, circa 73 t/s | Sì, circa 97 t/s | Sì |
| Qwen3 8B (Ollama) | 5,2 GB | Non in modo affidabile | Sì, contesto moderato, circa 86 t/s | Sì |
| Qwen 3.5 9B | 6 GB | No | Al limite, circa 75 t/s | Sì |
| Qwen3 14B (Ollama) | 9,3 GB | No | No | Sì, contesto breve |
Questi limiti non vengono mai raggiunti nella pratica; servono a confrontare le schede tra loro e a capire se un modello sarà interattivo. Un modello che pesa il doppio genera a una velocità circa dimezzata. Per conversare, una velocità effettiva superiore a una decina di token al secondo consente una lettura confortevole.
#Turing nel 2026: ancora supportato
L'età della scheda preoccupa meno di quanto si creda. La documentazione di Ollama indica che supporta le GPU NVIDIA con capacità di calcolo 5.0 o superiore e un driver 550 o più recente, ed elenca la RTX 2060 nella famiglia con capacità di calcolo 7.5. Le note di rilascio di CUDA 13, dal canto loro, indicano che il supporto per Maxwell, Pascal e Volta è stato rimosso da alcune librerie: Turing è la generazione più vecchia che resta supportata in questo ambito. È un argomento a favore della 2060 rispetto alle GTX 10 nel lungo termine, anche se Ollama supporta ancora le capacità di calcolo da 5.0 a 6.2 con un driver 570 o più recente: il rischio è che le prossime funzionalità siano destinate solo alle architetture recenti.
Non è la potenza di calcolo a limitare la generazione di testo su questa scheda, ma la larghezza di banda della memoria: quindi non pagare un sovrapprezzo solo per i Tensor Cores. Il driver è il vero requisito: un'installazione aggiornata evita la maggior parte dei problemi di rilevamento della GPU.
#Il calcolo della memoria per la tua scheda
Il calcolo si fa in tre righe: memoria della scheda, meno circa 0,5 GB riservati dal sistema e dal motore, meno la memoria occupata dai pesi del modello, uguale allo spazio rimanente per la cache del contesto. Il consumo della cache per token dipende dall'architettura del modello; il calcolatore del sito lo indica per un modello specifico, e la quantizzazione della cache in q8_0 lo dimezza approssimativamente.
| Scheda | Utilizzabile (memoria − 0,5 GB) | Con Granite 4.2 8B (4,6 GB) | Con Qwen3 8B (5,2 GB) | Con Qwen3 14B (9,3 GB) |
|---|---|---|---|---|
| RTX 2060 6 GB | 5,5 GB | 0,9 GB | 0,3 GB | Non entra |
| RTX 2060 Super 8 GB | 7,5 GB | 2,9 GB | 2,3 GB | Non entra |
| RTX 2060 12 GB | 11,5 GB | 6,9 GB | 6,3 GB | 2,2 GB |
Questa tabella spiega perché la stessa famiglia di modelli è piacevole da usare sulla Super e poco pratica sulla versione da 6 GB: con meno di un gigabyte di margine, poche migliaia di token di contesto bastano a costringere il modello a spostare parte dell'esecuzione sul processore. Mostra anche che un 14B su 12 GB è effettivamente utilizzabile, ma con poco margine: 2,2 GB per il contesto, il che impone una finestra breve.
#Suggerimenti per le versioni 6 GB e 8 GB
Per la scheda da 6 GB, la guida «Quale LLM per 6 GB di VRAM» descrive in dettaglio il budget di memoria completo; in sintesi, punta a un modello da 4B o a un 8B con un contesto breve. Sulla Super da 8 GB, il contesto diventa il primo parametro da monitorare.
- 01Installare un driver recenteAggiorna il driver NVIDIA alla versione 550 o successiva, come richiesto da Ollama, poi installa Ollama per il tuo sistema.
- 02Scegliere la dimensione del modello6 GB: un 4B, o un 8B con contesto breve. 8 GB: un 8B in Q4 con un contesto da 4 000 a 8 000 token. 12 GB: un 14B in Q4, contesto breve.
- 03Ridurre la cache di contestoAttiva Flash Attention e la quantizzazione della cache in q8_0: secondo la FAQ di Ollama, questa dimezza circa la memoria occupata dalla cache rispetto a f16.
- 04Verificare con ollama psLa colonna Processor deve mostrare 100% GPU. Una ripartizione tra CPU e GPU indica che il modello non entra interamente nella VRAM e viene in parte trasferito nella RAM di sistema, quindi la velocità è più bassa.
- 05Chiudere le applicazioni che consumano molte risorseUn browser con accelerazione hardware o un gioco occupano VRAM che il modello non potrà utilizzare.
La FAQ di Ollama propone anche una quantizzazione q4_0 della cache, più aggressiva, che riduce ulteriormente l'uso di memoria al prezzo di una possibile perdita di qualità; provala nel tuo caso d'uso prima di mantenerla.
#Ciò che si può davvero fare con una 2060
- Chat e redazione
- Un 4B o un 8B risponde correttamente nell'uso quotidiano; è l'ambito in cui la scheda mantiene meglio le sue promesse.
- RAG e documenti
- Un piccolo modello da 4B e un modello di embedding si possono caricare in memoria; limita il numero di estratti inviati.
- Codice
- Autocompletamento con un piccolo modello di codice; nessun agente affidabile a questa dimensione.
- Ciò che va oltre le capacità della scheda
- I contesti molto lunghi, le attività di visione più impegnative, i modelli da 14B su 6 o 8 GB e qualsiasi agente che concatena l'uso di strumenti con prompt lunghi.
La 2060 è anche una scheda da 160 a 185 W: sotto carico continuo, si scalda e fa rumore come qualsiasi scheda della sua categoria. La guida sulla gestione termica spiega come limitare la potenza per un server che funziona tutto il giorno.
#Verdetto e quando passare a qualcosa di diverso
Una RTX 2060 già installata non va sostituita se la usi per la chat, la sintesi di testi e un RAG leggero. Se acquisti una scheda, la memoria viene prima di tutto: la variante da 12 GB o la 2060 Super da 8 GB sono preferibili a quella da 6 GB. I prezzi cambiano ogni settimana e non sono indicati in questa pagina; il monitoraggio del sito rileva il prezzo più basso di ogni scheda.
| Scheda | Cosa offre | Quali compromessi comporta |
|---|---|---|
| RTX 2060 6 GB | Punto di ingresso, modelli da 3 a 4B | Poco margine; 8B solo con un contesto molto breve |
| RTX 2060 Super 8 GB | 8B in Q4 senza difficoltà | 448 GB/s, più veloce della 3060 12 GB |
| RTX 3060 12 GB | 12 GB: 14B in Q4 e contesto lungo | 360 GB/s: più lenta della 2060 Super con lo stesso modello che entra nella memoria di entrambe |
| RTX 3050 6 GB | Efficienza energetica | 168 GB/s, metà della velocità della 2060 da 6 GB |
Questo confronto corregge un'idea diffusa: la RTX 3060 12 GB non è più veloce della 2060 Super nella generazione di testo. La sua larghezza di banda è di 360 GB/s secondo Wikipedia, contro 448 GB/s per la 2060 Super. Il suo vantaggio è la capacità: 12 GB permettono di caricare modelli che la Super non può ospitare. Scegli in base al modello che vuoi usare, non a una percentuale generica di velocità.
Se acquisti una scheda usata, controlla tre cose prima di tenerla. Verifica con nvidia-smi la memoria totale indicata: il nome della scheda non basta a distinguere le varianti da 6, 8 e 12 GB. Avvia una generazione continua per una ventina di minuti e monitora la temperatura e la frequenza del core: una scheda che rallenta molto ha bisogno di una pulizia o di nuova pasta termica. Infine, testa un modello reale con il contesto previsto e verifica con ollama ps che rimanga completamente sulla scheda.
- Quale LLM su RTX 3060 12 GB
- Quale LLM su RTX 2070 / 2070 Super
- Quale LLM usare su una RTX 3050
- Monitoraggio dei prezzi delle schede grafiche per l'IA locale
- Fonte: Wikipedia, serie GeForce 20
- Fonte: Ollama, hardware supportato
- Fonte: FAQ ufficiale di Ollama
#Domande frequenti
La RTX 2060 può eseguire un LLM?+
Qual è la data di uscita della RTX 2060?+
RTX 2060 o RTX 2060 Super per un LLM?+
Un moderno LLM da 8B può rientrare nella memoria di una RTX 2060 Super?+
Vale ancora la pena usare la RTX 2060 da 6 GB per l'IA locale?+
La RTX 3060 12 GB è più veloce della 2060 Super?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.