Principiante 11 minGTX 10

Quale LLM su GTX 1070 / 1080 (8 GB) ?

Risposta diretta

Sì: una GTX 1070, 1070 Ti o 1080 da 8 GB esegue senza difficoltà un modello da 7 a 9 miliardi di parametri in Q4, con un contesto ragionevole. Il benchmark pubblico di llama.cpp misura 37,82 token/s su una GTX 1070 Ti con un 7B Q4_0; la 1080, dotata di memoria più veloce, dovrebbe fare meglio, anche se manca una misurazione diretta. Oltre i 9 miliardi di parametri, gli 8 GB diventano un limite e l'architettura Pascal non ha più un futuro sul piano del software.

Le GTX 1070 (giugno 2016), 1070 Ti (novembre 2017) e 1080 (maggio 2016) condividono lo stesso chip GP104 e 8 GB di memoria. Sono diventate le schede usate più allettanti per provare un LLM locale senza spendere. Questa guida quantifica ciò che la loro memoria permette, ciò che le misurazioni pubbliche dicono della loro velocità e perché la data di fine del supporto di Pascal pesa più del prezzo.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#GTX 1070, 1070 Ti, 1080: ciò che le distingue per un LLM

Per un LLM, queste tre schede hanno la stessa capacità, 8 GB, e si distinguono per la larghezza di banda della memoria, che determina la velocità di generazione. La 1070 e la 1070 Ti usano GDDR5 su un bus a 256 bit, cioè 256 GB/s; la 1080 raggiunge 320 GB/s con GDDR5X. Poiché un LLM rilegge tutti i suoi pesi a ogni token, questa differenza del 25% si traduce quasi direttamente in una differenza di velocità, incidendo molto più dei 2.560 core della 1080 rispetto ai 1.920 della 1070. Nessuna delle tre ha Tensor Cores: Pascal utilizza ancora il calcolo CUDA classico.

Le tre schede a colpo d'occhio (Wikipedia, GeForce 10 series; misurazione: banco di prova llama.cpp)
SchedaCore CUDAMemoriaLarghezza di bandaVelocità misurata (7B Q4_0)
GTX 10701 9208 GB GDDR5256 GB/snon misurata sul banco di prova
GTX 1070 Ti2 4328 GB GDDR5256 GB/s37,82 token/s
GTX 10802 5608 GB GDDR5X320 GB/snon misurata sul banco di prova

Una GTX 1080 Ti, con 11 GB e 484 GB/s, appartiene a una categoria diversa: ha la propria pagina. Se la tua scheda è una 1080 Ti, leggi piuttosto la guida dedicata a essa.

#Cosa permettono veramente 8 GB

Il criterio che conta è il rapporto tra i pesi e la memoria disponibile, perché bisogna aggiungere anche la cache KV. Il riferimento fornito dal sito colloca un modello 7-8B in Q4 intorno a 5 GB di pesi: su 8 GB, ne restano circa 3 GB per il contesto e il sistema, un margine concreto. Un modello 9B in Q4, con 6 GB di pesi, lascia 2 GB: è possibile con un contesto breve. A 12 miliardi di parametri, i pesi raggiungono 7 GB: non resta quasi nulla.

Modelli con 8 GB, limiti teorici (banda passante ÷ peso; non sono misure)
Modello (Q4)Dimensione del modelloMargine su 8 GBLimite con una banda passante di 256 GB/sLimite di 320 GB/s
Granite 4.1 3B2 GB6 GB128 token/s160 token/s
Granite 4.2 8B4,6 GB3,4 GB55 token/s70 token/s
Qwen3.5 9B6 GB2 GB43 token/s53 token/s
Gemma 4 12B7 GB1 GBnon consigliatonon consigliato
Phi-4 14B9 GBnegativosupera la capacità di memoria della GPUsupera la capacità di memoria della GPU

Un limite teorico non viene mai raggiunto. Nel banco di prova pubblico, la GTX 1070 Ti raggiunge 37,82 token/s su un modello da 3,56 GiB, cioè circa il 56% del suo limite di 256 GB/s. Applicando lo stesso rendimento ai modelli sopra menzionati, un Granite 4.2 8B girerebbe intorno a 30 token/s su una 1070 Ti: si tratta di un'estrapolazione proporzionale, non di una misura.

#Cosa dicono i benchmark pubblici

QuelLLM non testa queste schede. I dati provengono dalla discussione «Performance of llama.cpp on Nvidia CUDA» nel repository llama.cpp, dove ogni contributore esegue llama-bench su Llama 2 7B in Q4_0 con tutti gli strati sulla GPU. La GTX 1070 Ti vi registra 714,44 token/s nell'elaborazione del prompt e 37,82 token/s nella generazione.

Per le schede della stessa pagina per cui sono disponibili misurazioni, il confronto è utile: la RTX 2060 Super, una scheda Turing da 8 GB a 256 bit, produce 60,04 token/s nello stesso test, contro 37,82 per la 1070 Ti. Con una banda passante della memoria simile, il guadagno è del 59%. Il benchmark spiega quindi la differenza meglio dei core o del prezzo: Turing sfrutta meglio la propria memoria.

Benchmark llama.cpp CUDA, Llama 2 7B Q4_0, senza Flash Attention
SchedaMemoriaPrompt (pp512)Generazione (tg128)
GTX 1070 Ti8 GB GDDR5, 256 bit714,44 token/s37,82 token/s
RTX 2060 Super8 GB GDDR6, 256 bit1 420,24 token/s60,04 token/s
GTX 1080 Ti11 GB GDDR5X, 352 bit1 084,41 token/s62,49 tokens/s

Questi numeri vanno letti con tre cautele. Ogni riga del benchmark è un contributo individuale: driver, sistema, raffreddamento e produttore della scheda variano da un contributore all'altro, il che spiega qualche punto di differenza per lo stesso chip. Il modello di test, un Llama 2 7B, è più vecchio e più piccolo dei modelli attuali: serve da riferimento comune, non da previsione per un modello specifico. Infine, la generazione dipende soprattutto dalla memoria, mentre la lettura del prompt dipende dalla potenza di calcolo: le due colonne non raccontano la stessa cosa.

i
Le differenze di velocità derivano anche dal prompt
La lettura del prompt è circa due volte più lenta sulla 1070 Ti rispetto alla 2060 Super. Su un lungo documento incollato nella conversazione, l'attesa prima della prima risposta è quindi notevolmente più lunga su Pascal.

#Stimare le prestazioni della GTX 1080 senza misurazioni: metodo e limiti

La 1080 non compare nei benchmark. Per farsene un'idea, si può applicare il rapporto tra le larghezze di banda: 320 ÷ 256 = 1,25, ossia circa 47 token/s (37,82 × 1,25) se l'efficienza resta identica a quella della 1070 Ti. È un'ipotesi plausibile, non un risultato: i driver, la versione di llama.cpp, la temperatura o il raffreddamento della scheda fanno variare sensibilmente la velocità di generazione.

Se acquisti una scheda usata per questo utilizzo, chiedi al venditore uno screenshot di un test reale, oppure esegui tu stesso llama-bench sul modello usato nel benchmark non appena ricevi la scheda: il risultato è direttamente confrontabile con la tabella pubblica.

#Il contesto: dove vanno i 3 GB di margine

Su 8 GB, un Granite 4.2 8B in Q4 lascia circa 3,4 GB. Questa riserva viene condivisa tra la cache KV, che cresce con ogni token della conversazione, i buffer di calcolo e lo spazio occupato dal driver e dalla visualizzazione se la scheda gestisce anche il tuo schermo. Ollama parte con una finestra di 4.096 token, modificabile tramite la variabile OLLAMA_CONTEXT_LENGTH; raddoppiare la finestra raddoppia la cache KV.

Una semplice regola per decidere: se vuoi lavorare su documenti lunghi (16.000 token e oltre), scegli un modello da 3 a 4 miliardi di parametri, oppure un 8B con una cache KV quantizzata. Se conversi con messaggi brevi, un 8B in Q4 è la scelta giusta. In entrambi i casi, verifica con ollama ps che il modello sia caricato al 100% sulla GPU: una ripartizione tra GPU e processore indica che il margine è esaurito.

#Flash Attention su Pascal: utile o no?

Un'idea diffusa è che Flash Attention sia riservata alle schede con Tensor Cores. Il banco di prova di llama.cpp la smentisce: esegue i test su ogni scheda con e senza Flash Attention, e la GTX 1080 Ti, di generazione Pascal, compare in entrambe le tabelle. Con Flash Attention, passa da 1 084,41 a 1 138,14 token/s nell'elaborazione del prompt, cioè circa il 5 % in più, e da 62,49 a 61,38 token/s nella generazione, cioè il 2 % in meno. Il principale vantaggio di Flash Attention non è la velocità ma la memoria: riduce la memoria occupata dal contesto, un aspetto che conta su 8 GB.

Ollama attiva automaticamente Flash Attention quando il motore e la scheda la supportano; la variabile OLLAMA_FLASH_ATTENTION=1 ne forza l'attivazione, mentre il valore 0 la disattiva. La quantizzazione della cache KV, che riduce ulteriormente la memoria del contesto, richiede che Flash Attention sia attiva.

Forzare l'attivazione di Flash Attention all'avvio del server
OLLAMA_FLASH_ATTENTION=1 ollama serve

#Per quali usi è adatta una scheda Pascal da 8 GB?

Carichi di lavoro comuni e adeguatezza
UsoIdoneitàImpostazione consigliata
Chat, riformulazione, traduzioneBuonaGranite 4.2 8B in Q4, contesto di 4.096 token
Assistenza alla programmazione nell'editorDiscretaModello 7-8B, contesto medio, un solo modello caricato
Riepilogo di documenti lunghiLimitatoModello da 3-4B o cache KV quantizzata
Ricerca sui propri documenti (RAG)DiscretaModello da 3–8B, estratti brevi, niente modelli da 12B
Agenti con chiamate agli strumenti concatenateDeboleTroppo contesto e troppe chiamate per 8 GB

#Pascal: il supporto software, il vero limite

Il rischio principale non deriva dalla velocità ma dal software. Ollama richiede un driver NVIDIA 570 o più recente per le schede con compute capability da 5.0 a 6.2, tra cui quelle dalla GTX 1070 alla GTX 1080. Tuttavia, le note di rilascio di CUDA 13 indicano che il supporto per Pascal è stato rimosso, e Wikipedia ricorda che NVIDIA ha interrotto il supporto Game Ready per questa generazione a dicembre 2025, con aggiornamenti di sicurezza fino a ottobre 2028.

Aujourd'hui
Ollama e llama.cpp funzionano con un driver 570 o superiore e con build CUDA 12.
Domani
Le nuove funzioni e i nuovi motori punteranno su CUDA 13: ogni aggiornamento può eliminare il supporto per Pascal.
Sicurezza
Correzioni di sicurezza del driver sono disponibili fino a ottobre 2028, ma non ci sono nuove ottimizzazioni.
!
Non fidarti della data del 2028
Questa data riguarda la sicurezza del driver, non la compatibilità degli strumenti di IA. Un motore di inferenza può smettere di supportare Pascal molto prima: prevedi una scheda sostitutiva.

#È meglio una 1070 Ti o un'altra opzione?

A parità di budget sul mercato dell'usato, il confronto si basa su tre criteri: la memoria (almeno 8 GB), la generazione dell'architettura (Turing o più recente per beneficiare di CUDA 13) e la larghezza di banda. Senza citare prezzi, che cambiano ogni settimana, ecco come si posizionano le opzioni.

Opzioni di fascia entry-level per un LLM locale
OpzionePunti di forzaPunti deboli
GTX 1070 / 1070 Ti / 1080 (già posseduta)Gratuita; gestisce senza difficoltà modelli da 7–9BPascal a fine supporto, più lenta a parità di banda passante
RTX 2060 Super (8 GB)60,04 token/s nei benchmark, Turing, Tensor CoresSempre 8 GB
RTX 3050 (6 o 8 GB)Ampere, supporto software di lunga durataBanda passante limitata a seconda della versione
Scheda da 12 GB (RTX 3060 12 GB)Margine per 12-14B e contesto lungoBudget più elevato

#Verdetto: scoprire sì, investire no

Se possiedi già una GTX 1070, 1070 Ti o 1080, è un ottimo punto di partenza: 8 GB bastano per un modello 8B in Q4 e la velocità di generazione resta confortevole per la chat. Se vuoi acquistarne una, privilegia una scheda da 8 GB con architettura Turing o più recente: a parità di memoria, le velocità di generazione sono nettamente migliori e il supporto software dura più a lungo.

Un ultimo criterio pratico: il consumo. Queste schede hanno un consumo compreso tra 150 e 180 W durante il gioco; durante l'inferenza si scaldano meno che durante il gioco, ma un case poco ventilato può ridurre la velocità di generazione. Verifica le temperature durante una lunga generazione prima di concludere che la scheda sia lenta.

FAQ
Una GTX 1070 o 1080 può eseguire un modello 8B?+
Sì. Un Granite 4.2 8B in Q4 occupa circa 4,6 GB, lasciando più di 3 GB su 8 GB per il contesto e il sistema. Il benchmark di llama.cpp riporta 37,82 token/s su una 1070 Ti con un 7B Q4_0, una velocità confortevole per la chat.
GTX 1070 o GTX 1080 per un LLM locale?+
La 1080. La sua memoria GDDR5X a 320 GB/s contro i 256 GB/s della 1070 aumenta la velocità di generazione di circa il 25 % a parità di modello, poiché la velocità è limitata dalla memoria. La capacità rimane la stessa, 8 GB. Verifica lo stato e il raffreddamento di una scheda usata.
Quanti token al secondo su una GTX 1080?+
Non esistono misure della GTX 1080 sul benchmark pubblico di llama.cpp. La GTX 1070 Ti, a 256 GB/s, raggiunge 37,82 token/s su un 7B Q4_0. In proporzione alle bande passanti, la 1080 dovrebbe superare i 45 token/s, una stima da verificare con un llama-bench.
È possibile eseguire Qwen3.5 9B su una GTX 1070?+
Sì, ma con poco margine: i pesi in Q4 occupano circa 6 GB su 8 e restano 2 GB per la cache KV e il sistema. Mantieni un contesto breve e controlla con ollama ps che il modello rimanga sulla GPU.
Conviene comprare una GTX 1080 usata nel 2026?+
Solo a un prezzo molto basso e per provare. Pascal è stato rimosso da CUDA 13 e il supporto Game Ready è terminato a dicembre 2025; una RTX 2060 Super da 8 GB produce 60,04 token/s nei test al banco contro 37,82 per una 1070 Ti. A budget simile, la scheda Turing è l'acquisto migliore.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.