Quale LLM su GTX 1650 / 1660 / Super / Ti ?
Una GTX 1660 (6 GB) esegue un LLM locale da 7 a 8 miliardi di parametri in Q4: il benchmark pubblico di llama.cpp misura 41,35 token/s in generazione su un 7B Q4_0, ma solo 148,91 token/s nella lettura del prompt. Le 1660 Super e Ti, con memoria più veloce, dovrebbero essere più rapide. La GTX 1650, limitata a 4 GB, si limita ai modelli da 2 a 3 miliardi di parametri. Tutte restano supportate da CUDA 13.
La serie GTX 16, lanciata nel 2019, si basa sull'architettura Turing, senza Tensor Cores né core per il ray tracing. A differenza delle GTX 10, non è interessata dalla fine del supporto a Pascal. Questa guida distingue le quattro schede in base a ciò che conta per un LLM, cioè la memoria e la sua larghezza di banda, si basa su misurazioni pubbliche e segnala un'insidia: una generazione corretta non implica una lettura rapida dei prompt lunghi.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La serie GTX 16 per un LLM: cosa ricordare
Per un LLM, la serie GTX 16 va valutata in base alla memoria: 4 GB per la GTX 1650, 6 GB per le GTX 1660, 1660 Super e 1660 Ti. La velocità di generazione segue la larghezza di banda, che varia dal valore minimo al triplo: 128 GB/s per la 1650 con GDDR5, 192 GB/s per la 1660, 288 GB/s per la 1660 Ti e 336 GB/s per la 1660 Super. A parità di capacità di 6 GB, la 1660 Super è quindi la più veloce della serie e la 1660 originale la più lenta.
| Scheda | Memoria | Larghezza di banda | Core CUDA |
|---|---|---|---|
| GTX 1650 (GDDR5) | 4 GB, GDDR5, 128 bit | 128 GB/s | 896 |
| GTX 1650 (GDDR6, aprile 2020) | GDDR6 | 192 GB/s | 896 |
| GTX 1660 | 6 GB, GDDR5, 192 bit | 192 GB/s | 1 408 |
| GTX 1660 Super | 6 GB, GDDR6 | 336 GB/s | non dettagliato |
| GTX 1660 Ti | 6 GB, GDDR6 | 288 GB/s | 1 536 |
La serie non ha né Tensor Cores né RT Cores: Wikipedia precisa che si basa sull'architettura Turing delle RTX 20, ma senza questi due tipi di unità, e che conserva i core dedicati alle operazioni su numeri interi. Per i modelli quantizzati con numeri interi, l'assenza di Tensor Cores incide poco sulla generazione.
#Turing senza Tensor Cores: cosa cambia rispetto a Pascal
Il punto forte della serie è il FP16. Per una GTX 1660, Wikipedia indica 8.617 GFLOPS in mezza precisione contro 4.309 in singola precisione: il FP16 è due volte più veloce del FP32, mentre su una GTX 10 di fascia consumer è molto più lento del FP32, come mostra la guida alla GTX 1080 Ti. Questo spiega perché la 1660, a parità di larghezza di banda di 192 GB/s, supera nettamente una GTX 1060 nella generazione e perché CUDA 13 non l'abbia abbandonata.
Il controesempio riguarda la lettura del prompt. Il benchmark llama.cpp misura 148,91 token/s sulla 1660 nell'elaborazione del prompt, contro 416,85 sulla GTX 1060: una scheda più recente può leggere un testo lungo quasi tre volte più lentamente. Il benchmark non dettaglia la causa; il risultato proviene da un singolo contributore e va interpretato come un ordine di grandezza. Basta comunque a moderare l'entusiasmo per i documenti lunghi.
| Scheda | Larghezza di banda | Prompt (pp512) | Generazione (tg128) |
|---|---|---|---|
| GTX 1060 6 GB (Pascal) | 192 GB/s | 416,85 token/s | 27,79 token/s |
| GTX 1660 6 GB (Turing) | 192 GB/s | 148,91 token/s | 41,35 token/s |
| Quadro T1000 4 GB | 128 GB/s | 79,44 token/s | 27,82 token/s |
#Le quattro varianti una alla volta
- GTX 1650 (4 GB)
- Il banco di prova non include una 1650, ma una Quadro T1000 da 4 GB e 128 bit, con la stessa banda passante: riesce a far girare un modello 7B in Q4_0 a 27,82 token/s con un contesto minimo. È il limite: con 4 GB, meglio un modello da 2 a 3 miliardi di parametri.
- GTX 1660 (6 GB GDDR5)
- La scheda del banco di prova: 41,35 token/s in generazione. La più lenta tra le schede da 6 GB, ma sufficiente per chattare in Q4.
- GTX 1660 Ti (6 GB GDDR6)
- 288 GB/s: il 50 % di larghezza di banda in più rispetto alla 1660, quindi ci si aspetta un aumento del throughput dello stesso ordine, da confermare con misurazioni.
- GTX 1660 Super (6 GB GDDR6)
- 336 GB/s : la migliore della serie per un LLM, con il 75% di banda passante in più rispetto alla 1660.
Queste estrapolazioni si basano esclusivamente sulla larghezza di banda. Riprendendo l'efficienza della 1660 (82 % del suo limite teorico), una 1660 Ti produrrebbe all'incirca 62 token/s e una 1660 Super circa 72 sullo stesso 7B Q4_0. Sono proiezioni da confermare con una misurazione sulla tua scheda, mai risultati.
Insidia all'acquisto: esistono due versioni della GTX 1650. La versione originale del 2019 utilizza GDDR5 su un bus a 128 bit, ossia 128 GB/s; una revisione dell'aprile 2020 passa a GDDR6 a 12 Gbit/s e 192 GB/s. Per un LLM, questo significa un aumento del 50% del throughput potenziale a parità di modello. Controlla la dicitura GDDR5 o GDDR6 nell'annuncio, oppure leggi la scheda in GPU-Z, prima di acquistare una 1650 usata.
#Il contesto su 4 e 6 GB: il vero limite
Ollama si avvia con una finestra di 4.096 token, modificabile tramite OLLAMA_CONTEXT_LENGTH. La cache KV cresce con ogni token della conversazione: raddoppiare la finestra raddoppia la cache. Su 6 GB, con un Granite 4.2 8B in Q4, il margine di circa 1,4 GB si esaurisce rapidamente; su 4 GB, un modello da 3B lascia 2 GB, un margine più ampio rispetto a quello di un 8B su 6 GB.
La regola pratica: anziché ricorrere a una quantizzazione più aggressiva, riduci la dimensione del modello o il contesto. Un modello 3B con un contesto lungo dà risultati migliori su queste schede rispetto a un modello 8B che viene eseguito in parte sul processore. Controlla sempre con ollama ps che il modello rimanga al 100% sulla GPU: l'esecuzione parziale sul processore fa crollare il numero di token generati al secondo, perché la memoria di sistema è molto più lenta della memoria della scheda.
| Uso | GTX 1650 (4 GB) | GTX 1660 / Super / Ti (6 GB) |
|---|---|---|
| Chat breve, traduzione, riformulazione | Modello da 2 a 3B | 8B in Q4, contesto breve |
| Completamento di codice nell'editor | Modello da 2 a 3B, qualità limitata | Modello da 7-8B possibile |
| Riepilogo di documenti lunghi | Non consigliato | Lento: lettura del prompt a 148,91 token/s sulla 1660 |
| Ricerca nei propri documenti (RAG) | Modello da 3B, estratti brevi | Modello da 3 a 8B, estratti brevi |
#Cosa ci sta: 4 GB contro 6 GB
Il sito indica un modello 3B in Q4 intorno a 2 GB e un modello 7-8B intorno a 5 GB, con la cache KV da aggiungere. Su 6 GB, rimangono circa 1,4 GB con un Granite 4.2 8B in Q4: sufficienti per un contesto di qualche migliaio di token, non di più. Su 4 GB, il massimo ragionevole è un modello 3B.
| Modello (Q4) | Dimensione del modello | Su 4 GB | Su 6 GB |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Senza difficoltà | Senza difficoltà |
| Granite 4.1 3B | 2 GB | Senza difficoltà | Senza difficoltà |
| Phi-4 Mini 3,8B | 3 GB | Stretto | Senza difficoltà |
| Granite 4.2 8B | 4,6 GB | Non entra | Margine di 1,4 GB |
| Qwen3.5 9B | 6 GB | Non entra | Supera la VRAM disponibile con il contesto |
Sulla 1650, limitati ai modelli da 2 a 4 miliardi di parametri; è anche la fascia giusta per la stesura di bozze, la traduzione o la classificazione. Sulle 1660, un 8B in Q4 è il limite: resta utilizzabile per la chat, ma lascia poco spazio a un contesto lungo.
#Supporto software: un vantaggio netto sulle GTX 10
Ollama richiede un driver NVIDIA 550 o successivo per le schede recenti, contro 570 per le schede con compute capability da 5.0 a 6.2 (Pascal incluso). L'elenco ufficiale di Ollama cita la GTX 1650 Ti e le RTX 20 tra le schede con compute capability 7.5. Le altre GTX 16 condividono la stessa architettura Turing senza essere nominate singolarmente nell'elenco: da verificare al momento dell'installazione.
Per quanto riguarda CUDA, le note di rilascio della versione 13 indicano che il supporto rimosso riguarda le architetture precedenti a Turing (Maxwell, Volta e Pascal): Turing, e quindi le GTX 16, resta supportata. Per un acquisto di seconda mano, questo è l'argomento principale a favore di una GTX 16 rispetto a una GTX 10 di prezzo simile.
| Punto | GTX 16 (Turing) | GTX 10 (Pascal) |
|---|---|---|
| Driver richiesto da Ollama | 550 o più recente | 570 o più recente |
| CUDA 13 | Supportato | Rimosso |
| Flash Attention in llama.cpp | Disponibile | Disponibile |
#Installa e configura
- 01Verificare il driverAvvia nvidia-smi: la versione deve superare 550.
- 02Installare OllamaSegui la guida di installazione per il tuo sistema, poi scarica un modello adatto alla memoria disponibile.
- 03Controllare il posizionamentoEsegui ollama ps: la colonna PROCESSOR deve mostrare 100 % GPU. Una ripartizione tra GPU e CPU segnala che il modello supera la capacità della VRAM.
- 04Limitare il contestoOllama parte con un contesto di 4.096 token. Con 4 o 6 GB, aumentalo solo se hai verificato che ci sia ancora spazio.
Flash Attention non è riservata alle schede con Tensor Core: llama.cpp la esegue sulla GTX 1660 come su una scheda Pascal, e il benchmark registra, con Flash Attention, 154,45 token/s nell'elaborazione del prompt e 41,43 nella generazione, contro rispettivamente 148,91 e 41,35 senza. Il guadagno è modesto, ma si riduce la memoria occupata dal contesto, il che è utile con 6 GB. Ollama la attiva automaticamente quando la scheda la supporta.
- Installa Ollama passo dopo passo
- Risolvere i problemi di Ollama: GPU non rilevata, lentezza
- Quantizzare la cache KV per risparmiare VRAM
#Verdetto: quale GTX 16 e quando passare a qualcosa di diverso
| La tua situazione | Raccomandazione |
|---|---|
| Hai una 1660 Super o 1660 Ti | Il migliore della serie: 8B in Q4, chat fluida |
| Hai una 1660 | Sufficiente per la chat; lettura dei prompt lenta |
| Hai una 1650 (4 GB) | Solo modelli con un numero di parametri compreso tra 2 e 4 miliardi |
| Vuoi leggere documenti lunghi | Una scheda Ampere o successiva legge il prompt molto più velocemente |
| Vuoi un modello da 12B o più grande | Cambiare fascia: puntare a 12 GB o più |
Un ultimo punto di riferimento: queste schede non sono fatte per carichi pesanti, ma il loro TDP rimane modesto (120 W per la GTX 1660, secondo Wikipedia). Per un assistente locale che risponde a poche domande al giorno, è un vantaggio reale rispetto a una scheda da 250 W.
A parità di budget per un acquisto di seconda mano, la 1660 Super è un'opzione migliore rispetto a una GTX 1060 o 1070: stessa capacità, memoria più veloce, supporto software più duraturo. Per un acquisto nuovo o un uso regolare, una RTX 3050 o una RTX 2060 aggiungono Tensor Cores e più memoria a seconda della versione. I prezzi cambiano ogni settimana: consulta la pagina dei prezzi del sito.
- Quale LLM usare su una RTX 3050
- Quale LLM su RTX 2060 / 2060 Super
- Quali modelli per 6 GB di VRAM, indipendentemente dalla scheda
- Confronta i prezzi delle GPU per l'IA
- Fonte: benchmark pubblico llama.cpp su CUDA
- Fonte: documentazione Ollama, hardware NVIDIA supportato
- Fonte: serie GeForce 16, caratteristiche
- Fonte: note di rilascio del CUDA Toolkit
È possibile eseguire un LLM su una GTX 1660?+
Quale GTX 16 scegliere per un LLM?+
La GTX 1650 4 GB può eseguire un modello 7B?+
Le GTX 16 supportano Flash Attention?+
Una GTX 1660 Super è migliore di una GTX 1060 per l'IA?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.