Quale LLM su GTX 1060 (6 GB) ?
Sì, una GTX 1060 da 6 GB può ancora eseguire un LLM locale nel 2026, a condizione di puntare su modelli da 2 a 8 miliardi di parametri in Q4 e di avere pazienza. Il benchmark pubblico di llama.cpp misura 27,79 token/s su un modello 7B Q4_0: un ritmo adatto alla lettura in chat, ma troppo lento per agenti o documenti lunghi. I 6 GB sono il vero limite e la scheda ormai dipende da driver a fine ciclo di vita.
La GTX 1060 è uscita a luglio 2016: è una scheda Pascal con 6 GB di GDDR5 e un bus a 192 bit, la scheda di fascia bassa più comune nei PC da gaming del decennio scorso. Questa guida spiega quali modelli riesce a far girare oggi, con quali throughput misurati da altri, quali superano la capacità della memoria video e quando diventa più ragionevole cambiare scheda che insistere.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La GTX 1060 6 GB nel 2026
La GTX 1060 6 GB è utilizzabile per un LLM locale a tre condizioni: un modello i cui pesi in Q4 restino sotto i 4,5 GB circa, un contesto breve e l'accettazione di una velocità di generazione nell'ordine di 25–30 token/s su un 7B. La classifica pubblica delle prestazioni di llama.cpp su CUDA riporta 27,79 token/s in generazione per un Llama 2 7B in Q4_0 (3,56 GiB), cioè un testo che appare un po' più velocemente di quanto lo si legga. Oltre gli 8 miliardi di parametri, o non appena richiedi un contesto lungo, i 6 GB non bastano più e il modello viene in parte trasferito nella RAM di sistema, facendo crollare la velocità di generazione.
- Architettura
- Pascal GP106, lanciata il 19 luglio 2016, 1280 nuclei CUDA (configurazione 1280:80:48)
- Memoria
- 6 GB di GDDR5 su un bus da 192 bit, cioè 192 GB/s con memoria a 8 Gbit/s; esiste una variante a 9 Gbit/s, a 216 GB/s.
- Software
- Compute capability 6.1: ancora riconosciuta da Ollama, ma con un driver 570 o più recente.
- Cosa manca
- Nessun Tensor Core: i vantaggi delle nuove schede sul calcolo matriciale non si applicano.
#Quale GTX 1060 hai: 3 GB, 5 GB, 6 GB
Il nome GTX 1060 indica diverse schede, e la scheda tecnica conta più dell'etichetta. Solo la versione da 6 GB è realmente adatta agli LLM; la versione da 3 GB non ha nemmeno gli stessi core.
| Variante | Core CUDA | Memoria | Bus |
|---|---|---|---|
| GTX 1060 3 GB | 1 152 | 3 GB | 192 bit |
| GTX 1060 5 GB (Cina, fine 2017) | 1 280 (40 ROP) | 5 GB | 160 bit |
| GTX 1060 6 GB | 1 280 | 6 GB | 192 bit |
| GTX 1060 6 GB GDDR5X (2018) | GP104 riciclato | 6 GB | 192 bit |
Sulla versione da 3 GB, un modello 3B in Q4 (circa 2 GB di pesi) lascia appena 1 GB per la cache KV e il sistema: è un giocattolo. Sulla versione da 5 GB, il margine è più ridotto rispetto a quella da 6 GB. Se sei indeciso sull’acquisto, non scegliere nessuna delle due.
#Ciò che funziona veramente su 6 GB
La domanda utile non è « quale modello entra in 6 GB », ma « quale ci sta includendo il contesto e lasciando un margine per il sistema ». I valori di riferimento del sito: un 7-8B in Q4 occupa circa 5 GB, un 3B circa 2 GB, un 14B circa 9 GB, considerando solo i pesi. A questi si aggiungono la cache KV, che cresce con la lunghezza della conversazione, e lo spazio riservato dal driver. La tabella qui sotto incrocia le dimensioni dei pesi in Q4 (catalogo QuelLLM) con il limite teorico della velocità di generazione su questa scheda.
| Modello (Q4) | Dimensione del modello | Margine su 6 GB | Limite teorico |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,8 GB | 160 token/s |
| Granite 4.1 3B | 2 GB | 4 GB | 96 token/s |
| Phi-4 Mini 3,8B | 3 GB | 3 GB | 64 token/s |
| Granite 4.2 8B | 4,6 GB | 1,4 GB | 42 token/s |
| Qwen3.5 9B | 6 GB | nessuna | supera la capacità di memoria della GPU |
| Gemma 4 12B / Phi-4 14B | 7–9 GB | negativo | supera la capacità di memoria della GPU |
Il limite teorico è ottimistico: la generazione di un token richiede di rileggere tutti i pesi attivi, quindi la velocità di generazione non può superare la banda passante divisa per la dimensione del modello. La velocità effettiva è più bassa, come mostra la sezione successiva.
In pratica, la fascia confortevole si situa tra 3 e 4 miliardi di parametri: un modello di questa dimensione lascia almeno 3 GB di spazio per il contesto, funziona senza problemi sulla GPU e risponde senza ritardi evidenti. I modelli da 7-8B sono ancora possibili per scambi brevi, ma basta un solo documento incollato nella conversazione per saturare la scheda. Per il trattamento di file lunghi, meglio un altro hardware.
#Ciò che misurano i benchmark pubblici
Nessuna velocità riportata in questa guida è stata misurata da QuelLLM. Gli unici dati citati provengono da un banco di prova pubblico: la discussione «Performance of llama.cpp on Nvidia CUDA» nel repository llama.cpp, in cui ogni collaboratore esegue llama-bench sullo stesso modello, Llama 2 7B in Q4_0. Per questa scheda, la discussione riporta 416,85 token/s nell'elaborazione del prompt (pp512) e 27,79 token/s nella generazione (tg128).
| Scheda | Larghezza di banda | Generazione (tg128) | Quota del limite massimo |
|---|---|---|---|
| GTX 1060 6 GB | 192 GB/s | 27,79 token/s | 55 % |
| GTX 1070 Ti 8 GB | 256 GB/s | 37,82 token/s | 56 % |
| GTX 1660 6 GB | 192 GB/s | 41,35 token/s | 82 % |
| GTX 1080 Ti 11 GB | 484 GB/s | 62,49 tokens/s | 49 % |
Emergono due considerazioni. Innanzitutto, la 1060 raggiunge poco più della metà del suo limite teorico. Inoltre, la GTX 1660, che ha la stessa banda passante di 192 GB/s, raggiunge 41,35 token/s: l'architettura Turing sfrutta molto meglio la stessa memoria. A parità di banda passante, una scheda Pascal rimane quindi circa un terzo più lenta di una Turing. Per un modello Granite 4.2 8B in Q4 (4,6 GB), la stima per semplice proporzionalità (27,79 × 3,82 ÷ 4,6) dà circa 23 token/s: è un calcolo, non una misurazione, e a questo si aggiunge la penalizzazione dovuta al contesto.
#Con 6 GB, conta il contesto, non il modello
Ollama utilizza per impostazione predefinita una finestra di 4.096 token, modificabile con la variabile OLLAMA_CONTEXT_LENGTH. Più è grande la finestra, più memoria occupa la cache KV, e con 6 GB il margine è ridotto. Un Granite 4.2 8B in Q4 lascia circa 1,4 GB per la cache e il sistema. Passare da 4.096 a 32.768 token moltiplica per otto la memoria occupata dalla cache KV: su questa scheda, il limite si raggiunge ben prima della finestra massima dichiarata dal modello.
Il metodo per restare sulla GPU: mantenere il contesto breve, scegliere un modello più piccolo piuttosto che una quantizzazione più aggressiva e verificare con il comando ollama ps che la colonna PROCESSOR mostri 100 % GPU. Una ripartizione tra CPU e GPU indica che il modello non entra interamente nella VRAM: il throughput allora crolla, perché la memoria di sistema è molto più lenta della GDDR5 della scheda.
La quantizzazione della cache KV, attivabile con Flash Attention, riduce ulteriormente l'occupazione di memoria: la guida dedicata illustra in dettaglio il guadagno. Il principio resta lo stesso su qualsiasi scheda: se il modello e il suo contesto non rientrano insieme nella memoria disponibile, riduci uno dei due.
#Driver e CUDA: la scadenza di Pascal
La GTX 1060 funziona ancora, ma il suo ecosistema software si restringe. La documentazione di Ollama precisa che le schede con compute capability da 5.0 a 6.2 richiedono un driver NVIDIA 570 o più recente, e la GTX 1060 figura nell'elenco delle schede riconosciute. Sul fronte NVIDIA, le note di rilascio di CUDA 13 indicano che il supporto alle architetture precedenti a Turing (Maxwell, Volta e Pascal) è stato abbandonato: i nuovi strumenti CUDA non sono più destinati alla tua scheda.
Per quanto riguarda i driver, Wikipedia riassume la situazione: NVIDIA ha interrotto nel dicembre 2025 il supporto Game Ready per Maxwell, Pascal e Volta, il ramo 580 è l'ultimo a supportarli e sono previsti aggiornamenti di sicurezza fino a ottobre 2028. In pratica, la scheda non riceverà più ottimizzazioni né aggiornamenti per la compatibilità con future versioni software.
| Componente | Situazione per la GTX 1060 |
|---|---|
| Ollama | Supportato con un driver 570 o successivo (elenco ufficiale di compatibilità) |
| CUDA Toolkit recente | Supporto per Pascal rimosso a partire da CUDA 13: puntare alle build CUDA 12 |
| Driver NVIDIA | Ramo 580, ultimi aggiornamenti di sicurezza fino a ottobre 2028 |
| Nuovi motori e nuove ottimizzazioni | Rischio crescente di incompatibilità: da verificare a ogni aggiornamento |
#Installare e verificare in quattro passaggi
- 01Verificare il driverAvvia nvidia-smi: la versione del driver deve essere 570 o superiore. Sia su Windows sia su Linux, installa un driver del ramo 580 se la versione installata è inferiore.
- 02Installare OllamaSegui la guida di installazione per il tuo sistema, poi scarica un piccolo modello (da 2 a 4 GB) prima di provare un 8B.
- 03Controllare il posizionamentoAvvia una conversazione, poi in un secondo terminale esegui ollama ps: la colonna PROCESSOR deve indicare il 100% GPU.
- 04RegolareSe la velocità di generazione è molto bassa o se interviene il processore, riduci il contesto o passa a un modello più piccolo.
#Verdetto: tenere, acquistare o sostituire
Se la scheda è già nel tuo PC, vale la pena dedicarle una serata di prova: va bene per chat brevi, riformulazione, traduzione o un piccolo assistente locale da 3-4 miliardi di parametri. Se pensi di comprarla per l'IA, la risposta è no: a parità di memoria, una scheda Turing o più recente offre velocità di generazione superiori a parità di banda passante, una migliore compatibilità software e un supporto molto più lungo.
| La tua situazione | Raccomandazione |
|---|---|
| Hai già la scheda e vuoi provare | Sì: modelli da 2 a 4 GB, contesto breve |
| Vuoi usare comodamente un modello 8B con 8.000 token di contesto | No: passare a una scheda da 8 GB o più |
| Vuoi modelli con un numero di parametri compreso tra 12 e 14 miliardi | No: mirare a 12 GB o più |
| Non sai se comprarne una usata | No: confrontare le schede Turing e Ampere di fascia base |
Per fare un confronto senza basarti sui prezzi riportati qui, che cambiano ogni settimana, consulta la pagina dei prezzi delle schede grafiche del sito e la guida ai modelli adatti a 6 GB di VRAM, per vedere cosa permettono altre schede con questa capacità di memoria.
- Confronta i prezzi delle GPU per l'IA
- Quali modelli per 6 GB di VRAM, indipendentemente dalla scheda
- Quale LLM usare su una RTX 3050
- VRAM: quanti GB servono per l'IA
- Fonte: documentazione Ollama, hardware NVIDIA supportato
- Fonte: benchmark pubblico llama.cpp su CUDA
- Fonte: note di rilascio del CUDA Toolkit
- Fonte: serie GeForce 10, caratteristiche e fine del supporto
La GTX 1060 6 GB può eseguire un modello 8B?+
GTX 1060 3 GB o 6 GB per un LLM?+
Quanti token al secondo su una GTX 1060?+
Ollama funziona ancora su una GTX 1060 nel 2026?+
Conviene comprare una GTX 1060 usata per l'IA?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.