Quale LLM su GTX 1070 / 1080 (8 GB) ?
Sì: una GTX 1070, 1070 Ti o 1080 da 8 GB esegue senza difficoltà un modello da 7 a 9 miliardi di parametri in Q4, con un contesto ragionevole. Il benchmark pubblico di llama.cpp misura 37,82 token/s su una GTX 1070 Ti con un 7B Q4_0; la 1080, dotata di memoria più veloce, dovrebbe fare meglio, anche se manca una misurazione diretta. Oltre i 9 miliardi di parametri, gli 8 GB diventano un limite e l'architettura Pascal non ha più un futuro sul piano del software.
Le GTX 1070 (giugno 2016), 1070 Ti (novembre 2017) e 1080 (maggio 2016) condividono lo stesso chip GP104 e 8 GB di memoria. Sono diventate le schede usate più allettanti per provare un LLM locale senza spendere. Questa guida quantifica ciò che la loro memoria permette, ciò che le misurazioni pubbliche dicono della loro velocità e perché la data di fine del supporto di Pascal pesa più del prezzo.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#GTX 1070, 1070 Ti, 1080: ciò che le distingue per un LLM
Per un LLM, queste tre schede hanno la stessa capacità, 8 GB, e si distinguono per la larghezza di banda della memoria, che determina la velocità di generazione. La 1070 e la 1070 Ti usano GDDR5 su un bus a 256 bit, cioè 256 GB/s; la 1080 raggiunge 320 GB/s con GDDR5X. Poiché un LLM rilegge tutti i suoi pesi a ogni token, questa differenza del 25% si traduce quasi direttamente in una differenza di velocità, incidendo molto più dei 2.560 core della 1080 rispetto ai 1.920 della 1070. Nessuna delle tre ha Tensor Cores: Pascal utilizza ancora il calcolo CUDA classico.
| Scheda | Core CUDA | Memoria | Larghezza di banda | Velocità misurata (7B Q4_0) |
|---|---|---|---|---|
| GTX 1070 | 1 920 | 8 GB GDDR5 | 256 GB/s | non misurata sul banco di prova |
| GTX 1070 Ti | 2 432 | 8 GB GDDR5 | 256 GB/s | 37,82 token/s |
| GTX 1080 | 2 560 | 8 GB GDDR5X | 320 GB/s | non misurata sul banco di prova |
Una GTX 1080 Ti, con 11 GB e 484 GB/s, appartiene a una categoria diversa: ha la propria pagina. Se la tua scheda è una 1080 Ti, leggi piuttosto la guida dedicata a essa.
#Cosa permettono veramente 8 GB
Il criterio che conta è il rapporto tra i pesi e la memoria disponibile, perché bisogna aggiungere anche la cache KV. Il riferimento fornito dal sito colloca un modello 7-8B in Q4 intorno a 5 GB di pesi: su 8 GB, ne restano circa 3 GB per il contesto e il sistema, un margine concreto. Un modello 9B in Q4, con 6 GB di pesi, lascia 2 GB: è possibile con un contesto breve. A 12 miliardi di parametri, i pesi raggiungono 7 GB: non resta quasi nulla.
| Modello (Q4) | Dimensione del modello | Margine su 8 GB | Limite con una banda passante di 256 GB/s | Limite di 320 GB/s |
|---|---|---|---|---|
| Granite 4.1 3B | 2 GB | 6 GB | 128 token/s | 160 token/s |
| Granite 4.2 8B | 4,6 GB | 3,4 GB | 55 token/s | 70 token/s |
| Qwen3.5 9B | 6 GB | 2 GB | 43 token/s | 53 token/s |
| Gemma 4 12B | 7 GB | 1 GB | non consigliato | non consigliato |
| Phi-4 14B | 9 GB | negativo | supera la capacità di memoria della GPU | supera la capacità di memoria della GPU |
Un limite teorico non viene mai raggiunto. Nel banco di prova pubblico, la GTX 1070 Ti raggiunge 37,82 token/s su un modello da 3,56 GiB, cioè circa il 56% del suo limite di 256 GB/s. Applicando lo stesso rendimento ai modelli sopra menzionati, un Granite 4.2 8B girerebbe intorno a 30 token/s su una 1070 Ti: si tratta di un'estrapolazione proporzionale, non di una misura.
#Cosa dicono i benchmark pubblici
QuelLLM non testa queste schede. I dati provengono dalla discussione «Performance of llama.cpp on Nvidia CUDA» nel repository llama.cpp, dove ogni contributore esegue llama-bench su Llama 2 7B in Q4_0 con tutti gli strati sulla GPU. La GTX 1070 Ti vi registra 714,44 token/s nell'elaborazione del prompt e 37,82 token/s nella generazione.
Per le schede della stessa pagina per cui sono disponibili misurazioni, il confronto è utile: la RTX 2060 Super, una scheda Turing da 8 GB a 256 bit, produce 60,04 token/s nello stesso test, contro 37,82 per la 1070 Ti. Con una banda passante della memoria simile, il guadagno è del 59%. Il benchmark spiega quindi la differenza meglio dei core o del prezzo: Turing sfrutta meglio la propria memoria.
| Scheda | Memoria | Prompt (pp512) | Generazione (tg128) |
|---|---|---|---|
| GTX 1070 Ti | 8 GB GDDR5, 256 bit | 714,44 token/s | 37,82 token/s |
| RTX 2060 Super | 8 GB GDDR6, 256 bit | 1 420,24 token/s | 60,04 token/s |
| GTX 1080 Ti | 11 GB GDDR5X, 352 bit | 1 084,41 token/s | 62,49 tokens/s |
Questi numeri vanno letti con tre cautele. Ogni riga del benchmark è un contributo individuale: driver, sistema, raffreddamento e produttore della scheda variano da un contributore all'altro, il che spiega qualche punto di differenza per lo stesso chip. Il modello di test, un Llama 2 7B, è più vecchio e più piccolo dei modelli attuali: serve da riferimento comune, non da previsione per un modello specifico. Infine, la generazione dipende soprattutto dalla memoria, mentre la lettura del prompt dipende dalla potenza di calcolo: le due colonne non raccontano la stessa cosa.
#Stimare le prestazioni della GTX 1080 senza misurazioni: metodo e limiti
La 1080 non compare nei benchmark. Per farsene un'idea, si può applicare il rapporto tra le larghezze di banda: 320 ÷ 256 = 1,25, ossia circa 47 token/s (37,82 × 1,25) se l'efficienza resta identica a quella della 1070 Ti. È un'ipotesi plausibile, non un risultato: i driver, la versione di llama.cpp, la temperatura o il raffreddamento della scheda fanno variare sensibilmente la velocità di generazione.
Se acquisti una scheda usata per questo utilizzo, chiedi al venditore uno screenshot di un test reale, oppure esegui tu stesso llama-bench sul modello usato nel benchmark non appena ricevi la scheda: il risultato è direttamente confrontabile con la tabella pubblica.
#Il contesto: dove vanno i 3 GB di margine
Su 8 GB, un Granite 4.2 8B in Q4 lascia circa 3,4 GB. Questa riserva viene condivisa tra la cache KV, che cresce con ogni token della conversazione, i buffer di calcolo e lo spazio occupato dal driver e dalla visualizzazione se la scheda gestisce anche il tuo schermo. Ollama parte con una finestra di 4.096 token, modificabile tramite la variabile OLLAMA_CONTEXT_LENGTH; raddoppiare la finestra raddoppia la cache KV.
Una semplice regola per decidere: se vuoi lavorare su documenti lunghi (16.000 token e oltre), scegli un modello da 3 a 4 miliardi di parametri, oppure un 8B con una cache KV quantizzata. Se conversi con messaggi brevi, un 8B in Q4 è la scelta giusta. In entrambi i casi, verifica con ollama ps che il modello sia caricato al 100% sulla GPU: una ripartizione tra GPU e processore indica che il margine è esaurito.
#Flash Attention su Pascal: utile o no?
Un'idea diffusa è che Flash Attention sia riservata alle schede con Tensor Cores. Il banco di prova di llama.cpp la smentisce: esegue i test su ogni scheda con e senza Flash Attention, e la GTX 1080 Ti, di generazione Pascal, compare in entrambe le tabelle. Con Flash Attention, passa da 1 084,41 a 1 138,14 token/s nell'elaborazione del prompt, cioè circa il 5 % in più, e da 62,49 a 61,38 token/s nella generazione, cioè il 2 % in meno. Il principale vantaggio di Flash Attention non è la velocità ma la memoria: riduce la memoria occupata dal contesto, un aspetto che conta su 8 GB.
Ollama attiva automaticamente Flash Attention quando il motore e la scheda la supportano; la variabile OLLAMA_FLASH_ATTENTION=1 ne forza l'attivazione, mentre il valore 0 la disattiva. La quantizzazione della cache KV, che riduce ulteriormente la memoria del contesto, richiede che Flash Attention sia attiva.
#Per quali usi è adatta una scheda Pascal da 8 GB?
| Uso | Idoneità | Impostazione consigliata |
|---|---|---|
| Chat, riformulazione, traduzione | Buona | Granite 4.2 8B in Q4, contesto di 4.096 token |
| Assistenza alla programmazione nell'editor | Discreta | Modello 7-8B, contesto medio, un solo modello caricato |
| Riepilogo di documenti lunghi | Limitato | Modello da 3-4B o cache KV quantizzata |
| Ricerca sui propri documenti (RAG) | Discreta | Modello da 3–8B, estratti brevi, niente modelli da 12B |
| Agenti con chiamate agli strumenti concatenate | Debole | Troppo contesto e troppe chiamate per 8 GB |
#Pascal: il supporto software, il vero limite
Il rischio principale non deriva dalla velocità ma dal software. Ollama richiede un driver NVIDIA 570 o più recente per le schede con compute capability da 5.0 a 6.2, tra cui quelle dalla GTX 1070 alla GTX 1080. Tuttavia, le note di rilascio di CUDA 13 indicano che il supporto per Pascal è stato rimosso, e Wikipedia ricorda che NVIDIA ha interrotto il supporto Game Ready per questa generazione a dicembre 2025, con aggiornamenti di sicurezza fino a ottobre 2028.
- Aujourd'hui
- Ollama e llama.cpp funzionano con un driver 570 o superiore e con build CUDA 12.
- Domani
- Le nuove funzioni e i nuovi motori punteranno su CUDA 13: ogni aggiornamento può eliminare il supporto per Pascal.
- Sicurezza
- Correzioni di sicurezza del driver sono disponibili fino a ottobre 2028, ma non ci sono nuove ottimizzazioni.
#È meglio una 1070 Ti o un'altra opzione?
A parità di budget sul mercato dell'usato, il confronto si basa su tre criteri: la memoria (almeno 8 GB), la generazione dell'architettura (Turing o più recente per beneficiare di CUDA 13) e la larghezza di banda. Senza citare prezzi, che cambiano ogni settimana, ecco come si posizionano le opzioni.
| Opzione | Punti di forza | Punti deboli |
|---|---|---|
| GTX 1070 / 1070 Ti / 1080 (già posseduta) | Gratuita; gestisce senza difficoltà modelli da 7–9B | Pascal a fine supporto, più lenta a parità di banda passante |
| RTX 2060 Super (8 GB) | 60,04 token/s nei benchmark, Turing, Tensor Cores | Sempre 8 GB |
| RTX 3050 (6 o 8 GB) | Ampere, supporto software di lunga durata | Banda passante limitata a seconda della versione |
| Scheda da 12 GB (RTX 3060 12 GB) | Margine per 12-14B e contesto lungo | Budget più elevato |
- Quale LLM su RTX 2060 / 2060 Super
- Quale LLM su RTX 3060 12 GB
- Quali modelli per 8 GB di VRAM, tutte le schede
- Confronta i prezzi delle GPU per l'IA
#Verdetto: scoprire sì, investire no
Se possiedi già una GTX 1070, 1070 Ti o 1080, è un ottimo punto di partenza: 8 GB bastano per un modello 8B in Q4 e la velocità di generazione resta confortevole per la chat. Se vuoi acquistarne una, privilegia una scheda da 8 GB con architettura Turing o più recente: a parità di memoria, le velocità di generazione sono nettamente migliori e il supporto software dura più a lungo.
Un ultimo criterio pratico: il consumo. Queste schede hanno un consumo compreso tra 150 e 180 W durante il gioco; durante l'inferenza si scaldano meno che durante il gioco, ma un case poco ventilato può ridurre la velocità di generazione. Verifica le temperature durante una lunga generazione prima di concludere che la scheda sia lenta.
- Fonte: benchmark pubblico llama.cpp su CUDA
- Fonte: documentazione Ollama, hardware NVIDIA supportato
- Fonte: serie GeForce 10, caratteristiche
- Fonte: note di rilascio del CUDA Toolkit
Una GTX 1070 o 1080 può eseguire un modello 8B?+
GTX 1070 o GTX 1080 per un LLM locale?+
Quanti token al secondo su una GTX 1080?+
È possibile eseguire Qwen3.5 9B su una GTX 1070?+
Conviene comprare una GTX 1080 usata nel 2026?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.