Principiante 11 minRTX 20

Quale LLM su RTX 2060 / 2060 Super (6-8 GB) ?

Risposta diretta

Sì, una RTX 2060 può eseguire un LLM locale: con 6 GB, un modello da 3 a 4 miliardi di parametri in Q4 entra comodamente in memoria; con 8 GB (2060 Super), un modello da 8B in Q4 (da 4,6 a 5,2 GB) entra in memoria con un contesto moderato; la variante da 12 GB di fine 2021 può ospitare un modello da 14B. Lanciata nel gennaio 2019, la 2060 è ancora supportata da Ollama e CUDA. Il suo vero limite è la memoria, non l'età.

Esistono tre schede con questo nome: la RTX 2060 di gennaio 2019 (6 GB), la 2060 Super di luglio 2019 (8 GB) e una 2060 di dicembre 2021 con 12 GB. Per l'IA locale non sono affatto equivalenti. Questa pagina presenta le caratteristiche di ciascuna, cosa riesce a eseguire oggi, cosa indica il calcolo della velocità e quando passare ad altro.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RTX 2060, 2060 Super, 2060 12 GB: tre schede, tre usi

La RTX 2060 è stata lanciata il 15 gennaio 2019, la 2060 Super il 9 luglio 2019 e una variante della 2060 con 12 GB il 7 dicembre 2021, secondo la tabella delle GeForce serie 20 di Wikipedia. Tutte sono basate sul chip Turing TU106. Per un LLM, ciò che conta è la memoria (capacità, bus, larghezza di banda) piuttosto che i core CUDA.

Le tre varianti (Wikipedia, serie GeForce 20)
SchedaData di uscitaCore CUDAMemoriaLarghezza di bandaPotenza
RTX 206015 gennaio 20191 9206 GB, bus a 192 bit336 GB/s160 W
RTX 2060 Super9 luglio 20192 1768 GB, bus 256 bit448 GB/s175 W
RTX 2060 12 GB7 dicembre 20212 17612 GBnon specificata in questa tabella185 W

La 2060 Super offre 448 GB/s di larghezza di banda contro i 336 GB/s della 2060 originale: a parità di modello, genera circa un terzo più velocemente. La variante da 12 GB è rara ed è arrivata più tardi, ma è di gran lunga la più interessante per l'IA locale: è l'unica delle tre che permette di caricare un 14B in Q4 (circa 9 GB) lasciando un margine di memoria. Verifica quindi la capacità esatta della scheda prima di qualsiasi acquisto: il nome da solo non la indica.

#Cosa può eseguire ogni variante

La regola è la stessa per qualsiasi scheda: i pesi in Q4 (riferimento del sito: 3B ≈ 2 GB, 7-8B ≈ 5 GB, 14B ≈ 9 GB) più la cache di contesto e circa 0,5 GB riservati dal sistema e dal motore. La tabella fornisce anche il limite teorico della velocità di generazione, dato dalla larghezza di banda divisa per la dimensione dei pesi. Non abbiamo misure della velocità di generazione su queste schede e non ne citiamo.

Modelli compatibili e limite teorico di generazione
Modello (Q4)Dimensione del modello2060 6 GB (336 GB/s)2060 Super 8 GB (448 GB/s)2060 12 GB
Gemma 4 2B1,2 GBSì, limite intorno a 280 t/sSì, circa 370 t/sSì
Qwen 3.5 4B2,3 GBSì, circa 146 t/sSì, circa 195 t/sSì
Granite 4.2 8B4,6 GBAl limite, contesto molto breve, circa 73 t/sSì, circa 97 t/sSì
Qwen3 8B (Ollama)5,2 GBNon in modo affidabileSì, contesto moderato, circa 86 t/sSì
Qwen 3.5 9B6 GBNoAl limite, circa 75 t/sSì
Qwen3 14B (Ollama)9,3 GBNoNoSì, contesto breve

Questi limiti non vengono mai raggiunti nella pratica; servono a confrontare le schede tra loro e a capire se un modello sarà interattivo. Un modello che pesa il doppio genera a una velocità circa dimezzata. Per conversare, una velocità effettiva superiore a una decina di token al secondo consente una lettura confortevole.

#Turing nel 2026: ancora supportato

L'età della scheda preoccupa meno di quanto si creda. La documentazione di Ollama indica che supporta le GPU NVIDIA con capacità di calcolo 5.0 o superiore e un driver 550 o più recente, ed elenca la RTX 2060 nella famiglia con capacità di calcolo 7.5. Le note di rilascio di CUDA 13, dal canto loro, indicano che il supporto per Maxwell, Pascal e Volta è stato rimosso da alcune librerie: Turing è la generazione più vecchia che resta supportata in questo ambito. È un argomento a favore della 2060 rispetto alle GTX 10 nel lungo termine, anche se Ollama supporta ancora le capacità di calcolo da 5.0 a 6.2 con un driver 570 o più recente: il rischio è che le prossime funzionalità siano destinate solo alle architetture recenti.

Non è la potenza di calcolo a limitare la generazione di testo su questa scheda, ma la larghezza di banda della memoria: quindi non pagare un sovrapprezzo solo per i Tensor Cores. Il driver è il vero requisito: un'installazione aggiornata evita la maggior parte dei problemi di rilevamento della GPU.

#Il calcolo della memoria per la tua scheda

Il calcolo si fa in tre righe: memoria della scheda, meno circa 0,5 GB riservati dal sistema e dal motore, meno la memoria occupata dai pesi del modello, uguale allo spazio rimanente per la cache del contesto. Il consumo della cache per token dipende dall'architettura del modello; il calcolatore del sito lo indica per un modello specifico, e la quantizzazione della cache in q8_0 lo dimezza approssimativamente.

Spazio rimanente per il contesto, esclusa la cache (stima)
SchedaUtilizzabile (memoria − 0,5 GB)Con Granite 4.2 8B (4,6 GB)Con Qwen3 8B (5,2 GB)Con Qwen3 14B (9,3 GB)
RTX 2060 6 GB5,5 GB0,9 GB0,3 GBNon entra
RTX 2060 Super 8 GB7,5 GB2,9 GB2,3 GBNon entra
RTX 2060 12 GB11,5 GB6,9 GB6,3 GB2,2 GB

Questa tabella spiega perché la stessa famiglia di modelli è piacevole da usare sulla Super e poco pratica sulla versione da 6 GB: con meno di un gigabyte di margine, poche migliaia di token di contesto bastano a costringere il modello a spostare parte dell'esecuzione sul processore. Mostra anche che un 14B su 12 GB è effettivamente utilizzabile, ma con poco margine: 2,2 GB per il contesto, il che impone una finestra breve.

#Suggerimenti per le versioni 6 GB e 8 GB

Per la scheda da 6 GB, la guida «Quale LLM per 6 GB di VRAM» descrive in dettaglio il budget di memoria completo; in sintesi, punta a un modello da 4B o a un 8B con un contesto breve. Sulla Super da 8 GB, il contesto diventa il primo parametro da monitorare.

  1. 01
    Installare un driver recente
    Aggiorna il driver NVIDIA alla versione 550 o successiva, come richiesto da Ollama, poi installa Ollama per il tuo sistema.
  2. 02
    Scegliere la dimensione del modello
    6 GB: un 4B, o un 8B con contesto breve. 8 GB: un 8B in Q4 con un contesto da 4 000 a 8 000 token. 12 GB: un 14B in Q4, contesto breve.
  3. 03
    Ridurre la cache di contesto
    Attiva Flash Attention e la quantizzazione della cache in q8_0: secondo la FAQ di Ollama, questa dimezza circa la memoria occupata dalla cache rispetto a f16.
  4. 04
    Verificare con ollama ps
    La colonna Processor deve mostrare 100% GPU. Una ripartizione tra CPU e GPU indica che il modello non entra interamente nella VRAM e viene in parte trasferito nella RAM di sistema, quindi la velocità è più bassa.
  5. 05
    Chiudere le applicazioni che consumano molte risorse
    Un browser con accelerazione hardware o un gioco occupano VRAM che il modello non potrà utilizzare.
Impostazioni per una scheda da 6 a 8 GB (da configurare prima di riavviare Ollama)
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_CONTEXT_LENGTH=6144

La FAQ di Ollama propone anche una quantizzazione q4_0 della cache, più aggressiva, che riduce ulteriormente l'uso di memoria al prezzo di una possibile perdita di qualità; provala nel tuo caso d'uso prima di mantenerla.

#Ciò che si può davvero fare con una 2060

Chat e redazione
Un 4B o un 8B risponde correttamente nell'uso quotidiano; è l'ambito in cui la scheda mantiene meglio le sue promesse.
RAG e documenti
Un piccolo modello da 4B e un modello di embedding si possono caricare in memoria; limita il numero di estratti inviati.
Codice
Autocompletamento con un piccolo modello di codice; nessun agente affidabile a questa dimensione.
Ciò che va oltre le capacità della scheda
I contesti molto lunghi, le attività di visione più impegnative, i modelli da 14B su 6 o 8 GB e qualsiasi agente che concatena l'uso di strumenti con prompt lunghi.

La 2060 è anche una scheda da 160 a 185 W: sotto carico continuo, si scalda e fa rumore come qualsiasi scheda della sua categoria. La guida sulla gestione termica spiega come limitare la potenza per un server che funziona tutto il giorno.

#Verdetto e quando passare a qualcosa di diverso

Una RTX 2060 già installata non va sostituita se la usi per la chat, la sintesi di testi e un RAG leggero. Se acquisti una scheda, la memoria viene prima di tutto: la variante da 12 GB o la 2060 Super da 8 GB sono preferibili a quella da 6 GB. I prezzi cambiano ogni settimana e non sono indicati in questa pagina; il monitoraggio del sito rileva il prezzo più basso di ogni scheda.

2060 o un'alternativa per l'IA locale?
SchedaCosa offreQuali compromessi comporta
RTX 2060 6 GBPunto di ingresso, modelli da 3 a 4BPoco margine; 8B solo con un contesto molto breve
RTX 2060 Super 8 GB8B in Q4 senza difficoltà448 GB/s, più veloce della 3060 12 GB
RTX 3060 12 GB12 GB: 14B in Q4 e contesto lungo360 GB/s: più lenta della 2060 Super con lo stesso modello che entra nella memoria di entrambe
RTX 3050 6 GBEfficienza energetica168 GB/s, metà della velocità della 2060 da 6 GB

Questo confronto corregge un'idea diffusa: la RTX 3060 12 GB non è più veloce della 2060 Super nella generazione di testo. La sua larghezza di banda è di 360 GB/s secondo Wikipedia, contro 448 GB/s per la 2060 Super. Il suo vantaggio è la capacità: 12 GB permettono di caricare modelli che la Super non può ospitare. Scegli in base al modello che vuoi usare, non a una percentuale generica di velocità.

Se acquisti una scheda usata, controlla tre cose prima di tenerla. Verifica con nvidia-smi la memoria totale indicata: il nome della scheda non basta a distinguere le varianti da 6, 8 e 12 GB. Avvia una generazione continua per una ventina di minuti e monitora la temperatura e la frequenza del core: una scheda che rallenta molto ha bisogno di una pulizia o di nuova pasta termica. Infine, testa un modello reale con il contesto previsto e verifica con ollama ps che rimanga completamente sulla scheda.

#Domande frequenti

FAQ
La RTX 2060 può eseguire un LLM?+
Sì. Con 6 GB, un modello da 3 a 4 miliardi di parametri in Q4 entra comodamente in memoria, e anche un 8B con un contesto molto breve. Ollama supporta le GPU con capacità di calcolo 7.5, tra cui la RTX 2060, con un driver 550 o più recente. Il limite è la memoria, non l'età della scheda.
Qual è la data di uscita della RTX 2060?+
La RTX 2060 è uscita il 15 gennaio 2019 con 6 GB di memoria. La RTX 2060 Super, con 8 GB, è seguita il 9 luglio 2019, e una variante della 2060 con 12 GB è apparsa il 7 dicembre 2021, secondo Wikipedia. Per l'IA locale, la capacità di memoria della variante conta più della sua data di uscita.
RTX 2060 o RTX 2060 Super per un LLM?+
La Super: 8 GB contro 6 GB e 448 GB/s contro 336 GB/s. Un modello 8B in Q4 (da 4,6 a 5,2 GB) trova spazio nella memoria della Super con un contesto moderato, e la generazione è circa un terzo più veloce a parità di modello, in base alla banda passante. Sulla versione da 6 GB, resta su un modello 4B.
Un moderno LLM da 8B può rientrare nella memoria di una RTX 2060 Super?+
Sì, in Q4: Granite 4.2 8B pesa 4,6 GB e Qwen3 8B 5,2 GB nella libreria Ollama, lasciando alcuni gigabyte per la cache su 8 GB. Limita il contesto a un valore compreso tra 4.000 e 8.000 token e verifica con ollama ps che il modello rimanga completamente sulla scheda.
Vale ancora la pena usare la RTX 2060 da 6 GB per l'IA locale?+
Solo se ne possiedi già una o se il prezzo è molto basso: basta per un 4B e per la chat. Se devi acquistarne una, preferisci una scheda da 8 GB o 12 GB, perché la memoria è il principale fattore limitante. I prezzi cambiano ogni settimana: consulta il monitoraggio dei prezzi sul sito.
La RTX 3060 12 GB è più veloce della 2060 Super?+
Per la generazione di testo, no: la sua banda passante è di 360 GB/s contro i 448 GB/s della 2060 Super, ed è proprio la banda passante a determinare la velocità quando il modello entra nella memoria di entrambe le schede. La 3060 da 12 GB prevale per la capacità, che permette di caricare un 14B in Q4 laddove la Super non ha memoria sufficiente.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.