Principiante 11 minGTX 16

Quale LLM su GTX 1650 / 1660 / Super / Ti ?

Risposta diretta

Una GTX 1660 (6 GB) esegue un LLM locale da 7 a 8 miliardi di parametri in Q4: il benchmark pubblico di llama.cpp misura 41,35 token/s in generazione su un 7B Q4_0, ma solo 148,91 token/s nella lettura del prompt. Le 1660 Super e Ti, con memoria più veloce, dovrebbero essere più rapide. La GTX 1650, limitata a 4 GB, si limita ai modelli da 2 a 3 miliardi di parametri. Tutte restano supportate da CUDA 13.

La serie GTX 16, lanciata nel 2019, si basa sull'architettura Turing, senza Tensor Cores né core per il ray tracing. A differenza delle GTX 10, non è interessata dalla fine del supporto a Pascal. Questa guida distingue le quattro schede in base a ciò che conta per un LLM, cioè la memoria e la sua larghezza di banda, si basa su misurazioni pubbliche e segnala un'insidia: una generazione corretta non implica una lettura rapida dei prompt lunghi.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#La serie GTX 16 per un LLM: cosa ricordare

Per un LLM, la serie GTX 16 va valutata in base alla memoria: 4 GB per la GTX 1650, 6 GB per le GTX 1660, 1660 Super e 1660 Ti. La velocità di generazione segue la larghezza di banda, che varia dal valore minimo al triplo: 128 GB/s per la 1650 con GDDR5, 192 GB/s per la 1660, 288 GB/s per la 1660 Ti e 336 GB/s per la 1660 Super. A parità di capacità di 6 GB, la 1660 Super è quindi la più veloce della serie e la 1660 originale la più lenta.

Banda passante e memoria delle GTX 16 (Wikipedia, GeForce 16 series)
SchedaMemoriaLarghezza di bandaCore CUDA
GTX 1650 (GDDR5)4 GB, GDDR5, 128 bit128 GB/s896
GTX 1650 (GDDR6, aprile 2020)GDDR6192 GB/s896
GTX 16606 GB, GDDR5, 192 bit192 GB/s1 408
GTX 1660 Super6 GB, GDDR6336 GB/snon dettagliato
GTX 1660 Ti6 GB, GDDR6288 GB/s1 536

La serie non ha né Tensor Cores né RT Cores: Wikipedia precisa che si basa sull'architettura Turing delle RTX 20, ma senza questi due tipi di unità, e che conserva i core dedicati alle operazioni su numeri interi. Per i modelli quantizzati con numeri interi, l'assenza di Tensor Cores incide poco sulla generazione.

#Turing senza Tensor Cores: cosa cambia rispetto a Pascal

Il punto forte della serie è il FP16. Per una GTX 1660, Wikipedia indica 8.617 GFLOPS in mezza precisione contro 4.309 in singola precisione: il FP16 è due volte più veloce del FP32, mentre su una GTX 10 di fascia consumer è molto più lento del FP32, come mostra la guida alla GTX 1080 Ti. Questo spiega perché la 1660, a parità di larghezza di banda di 192 GB/s, supera nettamente una GTX 1060 nella generazione e perché CUDA 13 non l'abbia abbandonata.

Il controesempio riguarda la lettura del prompt. Il benchmark llama.cpp misura 148,91 token/s sulla 1660 nell'elaborazione del prompt, contro 416,85 sulla GTX 1060: una scheda più recente può leggere un testo lungo quasi tre volte più lentamente. Il benchmark non dettaglia la causa; il risultato proviene da un singolo contributore e va interpretato come un ordine di grandezza. Basta comunque a moderare l'entusiasmo per i documenti lunghi.

Banco di prova llama.cpp CUDA, Llama 2 7B Q4_0: una 1660 a confronto con le schede vicine
SchedaLarghezza di bandaPrompt (pp512)Generazione (tg128)
GTX 1060 6 GB (Pascal)192 GB/s416,85 token/s27,79 token/s
GTX 1660 6 GB (Turing)192 GB/s148,91 token/s41,35 token/s
Quadro T1000 4 GB128 GB/s79,44 token/s27,82 token/s
!
Un solo contributo, una sola scheda
Ogni riga del benchmark proviene da un contributore, con il suo driver e il suo sistema. Confrontare una 1660 con una 1060 in questo benchmark dà un ordine di grandezza, non una legge. Se l'elaborazione del prompt conta per te, prova la tua scheda con llama-bench.

#Le quattro varianti una alla volta

GTX 1650 (4 GB)
Il banco di prova non include una 1650, ma una Quadro T1000 da 4 GB e 128 bit, con la stessa banda passante: riesce a far girare un modello 7B in Q4_0 a 27,82 token/s con un contesto minimo. È il limite: con 4 GB, meglio un modello da 2 a 3 miliardi di parametri.
GTX 1660 (6 GB GDDR5)
La scheda del banco di prova: 41,35 token/s in generazione. La più lenta tra le schede da 6 GB, ma sufficiente per chattare in Q4.
GTX 1660 Ti (6 GB GDDR6)
288 GB/s: il 50 % di larghezza di banda in più rispetto alla 1660, quindi ci si aspetta un aumento del throughput dello stesso ordine, da confermare con misurazioni.
GTX 1660 Super (6 GB GDDR6)
336 GB/s : la migliore della serie per un LLM, con il 75% di banda passante in più rispetto alla 1660.

Queste estrapolazioni si basano esclusivamente sulla larghezza di banda. Riprendendo l'efficienza della 1660 (82 % del suo limite teorico), una 1660 Ti produrrebbe all'incirca 62 token/s e una 1660 Super circa 72 sullo stesso 7B Q4_0. Sono proiezioni da confermare con una misurazione sulla tua scheda, mai risultati.

Insidia all'acquisto: esistono due versioni della GTX 1650. La versione originale del 2019 utilizza GDDR5 su un bus a 128 bit, ossia 128 GB/s; una revisione dell'aprile 2020 passa a GDDR6 a 12 Gbit/s e 192 GB/s. Per un LLM, questo significa un aumento del 50% del throughput potenziale a parità di modello. Controlla la dicitura GDDR5 o GDDR6 nell'annuncio, oppure leggi la scheda in GPU-Z, prima di acquistare una 1650 usata.

#Il contesto su 4 e 6 GB: il vero limite

Ollama si avvia con una finestra di 4.096 token, modificabile tramite OLLAMA_CONTEXT_LENGTH. La cache KV cresce con ogni token della conversazione: raddoppiare la finestra raddoppia la cache. Su 6 GB, con un Granite 4.2 8B in Q4, il margine di circa 1,4 GB si esaurisce rapidamente; su 4 GB, un modello da 3B lascia 2 GB, un margine più ampio rispetto a quello di un 8B su 6 GB.

La regola pratica: anziché ricorrere a una quantizzazione più aggressiva, riduci la dimensione del modello o il contesto. Un modello 3B con un contesto lungo dà risultati migliori su queste schede rispetto a un modello 8B che viene eseguito in parte sul processore. Controlla sempre con ollama ps che il modello rimanga al 100% sulla GPU: l'esecuzione parziale sul processore fa crollare il numero di token generati al secondo, perché la memoria di sistema è molto più lenta della memoria della scheda.

Quale utilizzo per quale scheda?
UsoGTX 1650 (4 GB)GTX 1660 / Super / Ti (6 GB)
Chat breve, traduzione, riformulazioneModello da 2 a 3B8B in Q4, contesto breve
Completamento di codice nell'editorModello da 2 a 3B, qualità limitataModello da 7-8B possibile
Riepilogo di documenti lunghiNon consigliatoLento: lettura del prompt a 148,91 token/s sulla 1660
Ricerca nei propri documenti (RAG)Modello da 3B, estratti breviModello da 3 a 8B, estratti brevi

#Cosa ci sta: 4 GB contro 6 GB

Il sito indica un modello 3B in Q4 intorno a 2 GB e un modello 7-8B intorno a 5 GB, con la cache KV da aggiungere. Su 6 GB, rimangono circa 1,4 GB con un Granite 4.2 8B in Q4: sufficienti per un contesto di qualche migliaio di token, non di più. Su 4 GB, il massimo ragionevole è un modello 3B.

Cosa entra in 4 GB e in 6 GB (peso in Q4, catalogo QuelLLM)
Modello (Q4)Dimensione del modelloSu 4 GBSu 6 GB
Gemma 4 2B1,2 GBSenza difficoltàSenza difficoltà
Granite 4.1 3B2 GBSenza difficoltàSenza difficoltà
Phi-4 Mini 3,8B3 GBStrettoSenza difficoltà
Granite 4.2 8B4,6 GBNon entraMargine di 1,4 GB
Qwen3.5 9B6 GBNon entraSupera la VRAM disponibile con il contesto

Sulla 1650, limitati ai modelli da 2 a 4 miliardi di parametri; è anche la fascia giusta per la stesura di bozze, la traduzione o la classificazione. Sulle 1660, un 8B in Q4 è il limite: resta utilizzabile per la chat, ma lascia poco spazio a un contesto lungo.

#Supporto software: un vantaggio netto sulle GTX 10

Ollama richiede un driver NVIDIA 550 o successivo per le schede recenti, contro 570 per le schede con compute capability da 5.0 a 6.2 (Pascal incluso). L'elenco ufficiale di Ollama cita la GTX 1650 Ti e le RTX 20 tra le schede con compute capability 7.5. Le altre GTX 16 condividono la stessa architettura Turing senza essere nominate singolarmente nell'elenco: da verificare al momento dell'installazione.

Per quanto riguarda CUDA, le note di rilascio della versione 13 indicano che il supporto rimosso riguarda le architetture precedenti a Turing (Maxwell, Volta e Pascal): Turing, e quindi le GTX 16, resta supportata. Per un acquisto di seconda mano, questo è l'argomento principale a favore di una GTX 16 rispetto a una GTX 10 di prezzo simile.

Confronto del supporto software
PuntoGTX 16 (Turing)GTX 10 (Pascal)
Driver richiesto da Ollama550 o più recente570 o più recente
CUDA 13SupportatoRimosso
Flash Attention in llama.cppDisponibileDisponibile

#Installa e configura

  1. 01
    Verificare il driver
    Avvia nvidia-smi: la versione deve superare 550.
  2. 02
    Installare Ollama
    Segui la guida di installazione per il tuo sistema, poi scarica un modello adatto alla memoria disponibile.
  3. 03
    Controllare il posizionamento
    Esegui ollama ps: la colonna PROCESSOR deve mostrare 100 % GPU. Una ripartizione tra GPU e CPU segnala che il modello supera la capacità della VRAM.
  4. 04
    Limitare il contesto
    Ollama parte con un contesto di 4.096 token. Con 4 o 6 GB, aumentalo solo se hai verificato che ci sia ancora spazio.

Flash Attention non è riservata alle schede con Tensor Core: llama.cpp la esegue sulla GTX 1660 come su una scheda Pascal, e il benchmark registra, con Flash Attention, 154,45 token/s nell'elaborazione del prompt e 41,43 nella generazione, contro rispettivamente 148,91 e 41,35 senza. Il guadagno è modesto, ma si riduce la memoria occupata dal contesto, il che è utile con 6 GB. Ollama la attiva automaticamente quando la scheda la supporta.

#Verdetto: quale GTX 16 e quando passare a qualcosa di diverso

Decisione in base alla tua situazione
La tua situazioneRaccomandazione
Hai una 1660 Super o 1660 TiIl migliore della serie: 8B in Q4, chat fluida
Hai una 1660Sufficiente per la chat; lettura dei prompt lenta
Hai una 1650 (4 GB)Solo modelli con un numero di parametri compreso tra 2 e 4 miliardi
Vuoi leggere documenti lunghiUna scheda Ampere o successiva legge il prompt molto più velocemente
Vuoi un modello da 12B o più grandeCambiare fascia: puntare a 12 GB o più

Un ultimo punto di riferimento: queste schede non sono fatte per carichi pesanti, ma il loro TDP rimane modesto (120 W per la GTX 1660, secondo Wikipedia). Per un assistente locale che risponde a poche domande al giorno, è un vantaggio reale rispetto a una scheda da 250 W.

A parità di budget per un acquisto di seconda mano, la 1660 Super è un'opzione migliore rispetto a una GTX 1060 o 1070: stessa capacità, memoria più veloce, supporto software più duraturo. Per un acquisto nuovo o un uso regolare, una RTX 3050 o una RTX 2060 aggiungono Tensor Cores e più memoria a seconda della versione. I prezzi cambiano ogni settimana: consulta la pagina dei prezzi del sito.

FAQ
È possibile eseguire un LLM su una GTX 1660?+
Sì. Il benchmark pubblico di llama.cpp misura 41,35 token/s in generazione per un modello 7B in Q4_0 su una GTX 1660 da 6 GB, sufficienti per chattare. La lettura del prompt è più lenta (148,91 token/s), quindi i documenti lunghi richiedono un po' di attesa. Un modello 8B in Q4 è il limite ragionevole.
Quale GTX 16 scegliere per un LLM?+
La GTX 1660 Super: 6 GB e 336 GB/s di larghezza di banda, la migliore della serie per la generazione. Segue la 1660 Ti (288 GB/s), poi la 1660 (192 GB/s). Scegli la 1650 solo se punti a modelli da 2 a 3 miliardi di parametri.
La GTX 1650 4 GB può eseguire un modello 7B?+
A malapena. Il benchmark include una Quadro T1000 da 4 GB che esegue un modello 7B in Q4_0 a 27,82 token/s, con un contesto minimo. In pratica, una 1650 si comporta meglio con modelli da 2 a 3 miliardi di parametri, che lasciano spazio al contesto.
Le GTX 16 supportano Flash Attention?+
Sì. Il benchmark di llama.cpp misura Flash Attention su una GTX 1660: 154,45 token/s nella lettura del prompt e 41,43 nella generazione con Flash Attention, contro 148,91 e 41,35 senza. Il guadagno è modesto, ma Flash Attention riduce la memoria necessaria per il contesto. L'assenza di Tensor Cores non impedisce quindi a Flash Attention di funzionare.
Una GTX 1660 Super è migliore di una GTX 1060 per l'IA?+
Sì. A parità di capacità di 6 GB, la 1660 Super ha 336 GB/s contro 192 GB/s, e Turing sfrutta meglio la memoria: una 1660 raggiunge 41,35 token/s contro 27,79 di una 1060. Turing è anche supportato da CUDA 13, a differenza di Pascal.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.