Principiante 11 minGTX 10

Quale LLM su GTX 1060 (6 GB) ?

Risposta diretta

Sì, una GTX 1060 da 6 GB può ancora eseguire un LLM locale nel 2026, a condizione di puntare su modelli da 2 a 8 miliardi di parametri in Q4 e di avere pazienza. Il benchmark pubblico di llama.cpp misura 27,79 token/s su un modello 7B Q4_0: un ritmo adatto alla lettura in chat, ma troppo lento per agenti o documenti lunghi. I 6 GB sono il vero limite e la scheda ormai dipende da driver a fine ciclo di vita.

La GTX 1060 è uscita a luglio 2016: è una scheda Pascal con 6 GB di GDDR5 e un bus a 192 bit, la scheda di fascia bassa più comune nei PC da gaming del decennio scorso. Questa guida spiega quali modelli riesce a far girare oggi, con quali throughput misurati da altri, quali superano la capacità della memoria video e quando diventa più ragionevole cambiare scheda che insistere.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#La GTX 1060 6 GB nel 2026

La GTX 1060 6 GB è utilizzabile per un LLM locale a tre condizioni: un modello i cui pesi in Q4 restino sotto i 4,5 GB circa, un contesto breve e l'accettazione di una velocità di generazione nell'ordine di 25–30 token/s su un 7B. La classifica pubblica delle prestazioni di llama.cpp su CUDA riporta 27,79 token/s in generazione per un Llama 2 7B in Q4_0 (3,56 GiB), cioè un testo che appare un po' più velocemente di quanto lo si legga. Oltre gli 8 miliardi di parametri, o non appena richiedi un contesto lungo, i 6 GB non bastano più e il modello viene in parte trasferito nella RAM di sistema, facendo crollare la velocità di generazione.

Architettura
Pascal GP106, lanciata il 19 luglio 2016, 1280 nuclei CUDA (configurazione 1280:80:48)
Memoria
6 GB di GDDR5 su un bus da 192 bit, cioè 192 GB/s con memoria a 8 Gbit/s; esiste una variante a 9 Gbit/s, a 216 GB/s.
Software
Compute capability 6.1: ancora riconosciuta da Ollama, ma con un driver 570 o più recente.
Cosa manca
Nessun Tensor Core: i vantaggi delle nuove schede sul calcolo matriciale non si applicano.

#Quale GTX 1060 hai: 3 GB, 5 GB, 6 GB

Il nome GTX 1060 indica diverse schede, e la scheda tecnica conta più dell'etichetta. Solo la versione da 6 GB è realmente adatta agli LLM; la versione da 3 GB non ha nemmeno gli stessi core.

Le varianti della GTX 1060 (secondo la tabella delle GeForce 10 di Wikipedia)
VarianteCore CUDAMemoriaBus
GTX 1060 3 GB1 1523 GB192 bit
GTX 1060 5 GB (Cina, fine 2017)1 280 (40 ROP)5 GB160 bit
GTX 1060 6 GB1 2806 GB192 bit
GTX 1060 6 GB GDDR5X (2018)GP104 riciclato6 GB192 bit

Sulla versione da 3 GB, un modello 3B in Q4 (circa 2 GB di pesi) lascia appena 1 GB per la cache KV e il sistema: è un giocattolo. Sulla versione da 5 GB, il margine è più ridotto rispetto a quella da 6 GB. Se sei indeciso sull’acquisto, non scegliere nessuna delle due.

#Ciò che funziona veramente su 6 GB

La domanda utile non è « quale modello entra in 6 GB », ma « quale ci sta includendo il contesto e lasciando un margine per il sistema ». I valori di riferimento del sito: un 7-8B in Q4 occupa circa 5 GB, un 3B circa 2 GB, un 14B circa 9 GB, considerando solo i pesi. A questi si aggiungono la cache KV, che cresce con la lunghezza della conversazione, e lo spazio riservato dal driver. La tabella qui sotto incrocia le dimensioni dei pesi in Q4 (catalogo QuelLLM) con il limite teorico della velocità di generazione su questa scheda.

Modelli e 192 GB/s di banda passante (limite teorico = banda passante ÷ peso, mai una misura)
Modello (Q4)Dimensione del modelloMargine su 6 GBLimite teorico
Gemma 4 2B1,2 GB4,8 GB160 token/s
Granite 4.1 3B2 GB4 GB96 token/s
Phi-4 Mini 3,8B3 GB3 GB64 token/s
Granite 4.2 8B4,6 GB1,4 GB42 token/s
Qwen3.5 9B6 GBnessunasupera la capacità di memoria della GPU
Gemma 4 12B / Phi-4 14B7–9 GBnegativosupera la capacità di memoria della GPU

Il limite teorico è ottimistico: la generazione di un token richiede di rileggere tutti i pesi attivi, quindi la velocità di generazione non può superare la banda passante divisa per la dimensione del modello. La velocità effettiva è più bassa, come mostra la sezione successiva.

In pratica, la fascia confortevole si situa tra 3 e 4 miliardi di parametri: un modello di questa dimensione lascia almeno 3 GB di spazio per il contesto, funziona senza problemi sulla GPU e risponde senza ritardi evidenti. I modelli da 7-8B sono ancora possibili per scambi brevi, ma basta un solo documento incollato nella conversazione per saturare la scheda. Per il trattamento di file lunghi, meglio un altro hardware.

#Ciò che misurano i benchmark pubblici

Nessuna velocità riportata in questa guida è stata misurata da QuelLLM. Gli unici dati citati provengono da un banco di prova pubblico: la discussione «Performance of llama.cpp on Nvidia CUDA» nel repository llama.cpp, in cui ogni collaboratore esegue llama-bench sullo stesso modello, Llama 2 7B in Q4_0. Per questa scheda, la discussione riporta 416,85 token/s nell'elaborazione del prompt (pp512) e 27,79 token/s nella generazione (tg128).

Benchmark llama.cpp CUDA, Llama 2 7B Q4_0 (3,56 GiB), senza Flash Attention
SchedaLarghezza di bandaGenerazione (tg128)Quota del limite massimo
GTX 1060 6 GB192 GB/s27,79 token/s55 %
GTX 1070 Ti 8 GB256 GB/s37,82 token/s56 %
GTX 1660 6 GB192 GB/s41,35 token/s82 %
GTX 1080 Ti 11 GB484 GB/s62,49 tokens/s49 %

Emergono due considerazioni. Innanzitutto, la 1060 raggiunge poco più della metà del suo limite teorico. Inoltre, la GTX 1660, che ha la stessa banda passante di 192 GB/s, raggiunge 41,35 token/s: l'architettura Turing sfrutta molto meglio la stessa memoria. A parità di banda passante, una scheda Pascal rimane quindi circa un terzo più lenta di una Turing. Per un modello Granite 4.2 8B in Q4 (4,6 GB), la stima per semplice proporzionalità (27,79 × 3,82 ÷ 4,6) dà circa 23 token/s: è un calcolo, non una misurazione, e a questo si aggiunge la penalizzazione dovuta al contesto.

i
Perché conta anche l'elaborazione del prompt
Il benchmark riporta 416,85 token/s nell'elaborazione del prompt sulla 1060. Un prompt di 2.000 token (una lunga e-mail, una pagina di documentazione) richiede quindi circa cinque secondi prima della prima parola della risposta. È il ritardo che percepirai in pratica appena incolli un documento.

#Con 6 GB, conta il contesto, non il modello

Ollama utilizza per impostazione predefinita una finestra di 4.096 token, modificabile con la variabile OLLAMA_CONTEXT_LENGTH. Più è grande la finestra, più memoria occupa la cache KV, e con 6 GB il margine è ridotto. Un Granite 4.2 8B in Q4 lascia circa 1,4 GB per la cache e il sistema. Passare da 4.096 a 32.768 token moltiplica per otto la memoria occupata dalla cache KV: su questa scheda, il limite si raggiunge ben prima della finestra massima dichiarata dal modello.

Il metodo per restare sulla GPU: mantenere il contesto breve, scegliere un modello più piccolo piuttosto che una quantizzazione più aggressiva e verificare con il comando ollama ps che la colonna PROCESSOR mostri 100 % GPU. Una ripartizione tra CPU e GPU indica che il modello non entra interamente nella VRAM: il throughput allora crolla, perché la memoria di sistema è molto più lenta della GDDR5 della scheda.

Verificare che il modello entri nella memoria della GPU
ollama ps

La quantizzazione della cache KV, attivabile con Flash Attention, riduce ulteriormente l'occupazione di memoria: la guida dedicata illustra in dettaglio il guadagno. Il principio resta lo stesso su qualsiasi scheda: se il modello e il suo contesto non rientrano insieme nella memoria disponibile, riduci uno dei due.

#Driver e CUDA: la scadenza di Pascal

La GTX 1060 funziona ancora, ma il suo ecosistema software si restringe. La documentazione di Ollama precisa che le schede con compute capability da 5.0 a 6.2 richiedono un driver NVIDIA 570 o più recente, e la GTX 1060 figura nell'elenco delle schede riconosciute. Sul fronte NVIDIA, le note di rilascio di CUDA 13 indicano che il supporto alle architetture precedenti a Turing (Maxwell, Volta e Pascal) è stato abbandonato: i nuovi strumenti CUDA non sono più destinati alla tua scheda.

Per quanto riguarda i driver, Wikipedia riassume la situazione: NVIDIA ha interrotto nel dicembre 2025 il supporto Game Ready per Maxwell, Pascal e Volta, il ramo 580 è l'ultimo a supportarli e sono previsti aggiornamenti di sicurezza fino a ottobre 2028. In pratica, la scheda non riceverà più ottimizzazioni né aggiornamenti per la compatibilità con future versioni software.

Cosa cambia per un uso LLM
ComponenteSituazione per la GTX 1060
OllamaSupportato con un driver 570 o successivo (elenco ufficiale di compatibilità)
CUDA Toolkit recenteSupporto per Pascal rimosso a partire da CUDA 13: puntare alle build CUDA 12
Driver NVIDIARamo 580, ultimi aggiornamenti di sicurezza fino a ottobre 2028
Nuovi motori e nuove ottimizzazioniRischio crescente di incompatibilità: da verificare a ogni aggiornamento
!
Non aggiornare alla cieca
Se la tua installazione funziona, annota la versione del driver e quella di Ollama prima di qualsiasi aggiornamento, e tieni la versione precedente a portata di mano. Uno strumento recente compilato per CUDA 13 potrebbe non riconoscere più la scheda.

#Installare e verificare in quattro passaggi

  1. 01
    Verificare il driver
    Avvia nvidia-smi: la versione del driver deve essere 570 o superiore. Sia su Windows sia su Linux, installa un driver del ramo 580 se la versione installata è inferiore.
  2. 02
    Installare Ollama
    Segui la guida di installazione per il tuo sistema, poi scarica un piccolo modello (da 2 a 4 GB) prima di provare un 8B.
  3. 03
    Controllare il posizionamento
    Avvia una conversazione, poi in un secondo terminale esegui ollama ps: la colonna PROCESSOR deve indicare il 100% GPU.
  4. 04
    Regolare
    Se la velocità di generazione è molto bassa o se interviene il processore, riduci il contesto o passa a un modello più piccolo.

#Verdetto: tenere, acquistare o sostituire

Se la scheda è già nel tuo PC, vale la pena dedicarle una serata di prova: va bene per chat brevi, riformulazione, traduzione o un piccolo assistente locale da 3-4 miliardi di parametri. Se pensi di comprarla per l'IA, la risposta è no: a parità di memoria, una scheda Turing o più recente offre velocità di generazione superiori a parità di banda passante, una migliore compatibilità software e un supporto molto più lungo.

Decisione in base alla tua situazione
La tua situazioneRaccomandazione
Hai già la scheda e vuoi provareSì: modelli da 2 a 4 GB, contesto breve
Vuoi usare comodamente un modello 8B con 8.000 token di contestoNo: passare a una scheda da 8 GB o più
Vuoi modelli con un numero di parametri compreso tra 12 e 14 miliardiNo: mirare a 12 GB o più
Non sai se comprarne una usataNo: confrontare le schede Turing e Ampere di fascia base

Per fare un confronto senza basarti sui prezzi riportati qui, che cambiano ogni settimana, consulta la pagina dei prezzi delle schede grafiche del sito e la guida ai modelli adatti a 6 GB di VRAM, per vedere cosa permettono altre schede con questa capacità di memoria.

FAQ
La GTX 1060 6 GB può eseguire un modello 8B?+
Sì, in Q4: un Granite 4.2 8B pesa circa 4,6 GB e lascia 1,4 GB per il contesto e il sistema. La velocità sarà inferiore ai 27,79 token/s misurati su un 7B Q4_0 dal benchmark llama.cpp, e il contesto deve rimanere breve. Un modello da 3 a 4 miliardi di parametri è più comodo da usare.
GTX 1060 3 GB o 6 GB per un LLM?+
Solo la versione da 6 GB. La versione da 3 GB ha meno core CUDA (1 152 contro 1 280) e solo 3 GB di memoria: un modello 3B in Q4 ci sta a malapena insieme al suo contesto. È adatta a un piccolo modello da 1 a 2 miliardi di parametri, non a un assistente di chat serio.
Quanti token al secondo su una GTX 1060?+
Il benchmark pubblico di llama.cpp registra 27,79 token/s in generazione per un modello 7B in Q4_0 e 416,85 token/s per la lettura del prompt. Questi dati dipendono dal driver, dal sistema e dalla versione di llama.cpp: danno un ordine di grandezza, non una garanzia.
Ollama funziona ancora su una GTX 1060 nel 2026?+
Sì: la GTX 1060 figura nella lista dei dispositivi supportati, con una compute capability di 6.1. La documentazione richiede tuttavia un driver NVIDIA 570 o successivo per le schede con compute capability da 5.0 a 6.2. Verifica la tua versione con nvidia-smi prima di installare.
Conviene comprare una GTX 1060 usata per l'IA?+
No, salvo per una prova con un budget molto ridotto. Le architetture Turing e quelle più recenti sfruttano meglio la stessa larghezza di banda, e CUDA 13 non include più Pascal tra le architetture di destinazione. A parità di budget, una scheda Turing o Ampere da 8 GB offre più margine e un supporto software più duraturo.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.