Principiante 11 minRTX 20

Quale LLM su RTX 2070 / 2070 Super (8 GB)? ?

Risposta diretta

Una RTX 2070 o 2070 Super (8 GB di GDDR6) esegue senza difficoltà modelli da 7 a 9 miliardi di parametri in Q4: Granite 4.2 8B (4,6 GB di pesi) o Qwen 3.5 9B (6 GB) entrano interamente nella memoria della scheda. Nel test di riferimento di llama.cpp, la 2070 Super genera 88 token/s. Oltre i 9B, occorre caricare parte del modello nella RAM di sistema e la velocità di generazione crolla.

La RTX 2070 (ottobre 2018) e la RTX 2070 Super (luglio 2019) sono schede Turing con 8 GB di memoria. Nel 2026 sono adatte a un assistente 8B in Q4, ma al limite per tutto il resto. Questa guida collega le loro caratteristiche a un test di velocità pubblico, spiega come vengono utilizzati gli 8 GB e indica quando vale la pena cambiare scheda.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 2070 e 2070 Super: cosa permettono 8 GB

Su una RTX 2070 o una 2070 Super, i modelli da 7 a 9 miliardi di parametri con quantizzazione Q4 stanno interamente nella memoria video: è la zona di comfort di queste schede. Secondo il catalogo QuelLLM, i pesi di Granite 4.2 8B occupano 4,6 GB in Q4 e quelli di Qwen 3.5 9B circa 6 GB. Rimane quindi spazio per il contesto, purché la sua lunghezza resti ragionevole. Un modello da 12 miliardi come Gemma 4 12B (7 GB in Q4) lascia appena un gigabyte per la cache e il sistema: sulla carta ci sta, ma in pratica funziona male. Quanto alla velocità, la 2070 Super registra 88 token al secondo nel benchmark di riferimento di llama.cpp, con un modello da 7 miliardi in Q4_0, una velocità ben superiore a quella di lettura di una persona. Il vero limite di queste schede non è quindi la velocità, ma la capacità di memoria.

RTX 2070
Ottobre 2018, 2.304 core CUDA, 8 GB di GDDR6 su bus da 256 bit, cioè 448 GB/s (256 bit a 14 Gbit/s)
RTX 2070 Super
Luglio 2019, 2.560 core CUDA, ancora 8 GB e la stessa banda passante di 448 GB/s, consumo di 215 W.
Cosa le distingue per un LLM
Quasi niente: la banda passante e la capacità sono identiche. La Super ha più core, il che aiuta soprattutto nella lettura del prompt, non nella generazione.

Quest'ultimo punto è controintuitivo: per generare testo, il processore grafico rilegge tutti i pesi del modello a ogni token, quindi la larghezza di banda della memoria conta più del numero di core. Due schede con una larghezza di banda di 448 GB/s avranno velocità di generazione simili, anche se una è nettamente più veloce nei giochi.

#Quali modelli stanno in 8 GB

I pesi sono solo una parte del consumo di memoria: bisogna aggiungere la cache di contesto (KV cache), che cresce con la lunghezza della conversazione, e poi un margine per il driver e la gestione dello schermo. Su una scheda da 8 GB, la regola pratica è puntare a pesi di non più di 6 GB se vuoi un contesto di diverse migliaia di token. Come riferimento, lo strumento di test di llama.cpp rileva 7.838 MiB di memoria libera su una RTX 3060 Ti da 8 GB, cioè un po' meno degli 8.192 MiB teorici: alcune centinaia di megabyte sono già occupate prima ancora di caricare un modello.

Modelli per una RTX 2070 / 2070 Super (peso secondo il catalogo QuelLLM)
ModelloPesi in Q4Verdetto su 8 GB
Qwen 3.5 4B2,3 GB (Q8: 4,3 GB)Ampio margine, anche in Q8 e con un contesto lungo
Granite 4.2 8B4,6 GB (Q8 : 9 GB)Zona di comfort in Q4, contesto di migliaia di token
Qwen 3.5 9B6 GB (Q8 : 10 GB)Entra in memoria in Q4 con un contesto moderato; per contesti più lunghi usa la cache K/V quantizzata
Gemma 4 12B7 GB (Q8 : 13 GB)Limite: nessun margine per il contesto, probabile trasferimento di parte del modello in RAM

Un 8B in Q8 (9 GB) non ci sta: con 8 GB, la quantizzazione Q4 è la regola e la Q5 resta possibile per i modelli più piccoli. Per confrontare i livelli di quantizzazione, la guida alla scelta tra Q4, Q5 e Q8 descrive in dettaglio la perdita di qualità attesa. Per un progetto specifico, il calcolatore di VRAM del sito ti indica l'esatto consumo di memoria in base al modello e al contesto.

#Velocità: ciò che misura il test di riferimento

L'unico riferimento pubblico utilizzabile è la tabella collaborativa del repository llama.cpp, dove gli utenti pubblicano il risultato dello stesso comando: llama-bench su Llama 2 7B in Q4_0, un file da 3,56 GiB, con tutti i layer sulla GPU. La tabella precisa che i risultati variano in base al driver, al sistema e al produttore della scheda, anche a parità di chip. Non si tratta di misurazioni del sito: i dati riportati di seguito provengono da questa tabella, e la colonna «lettura» indica il throughput di elaborazione del prompt (pp512), mentre «generazione» indica il throughput della risposta (tg128).

Test llama.cpp, Llama 2 7B Q4_0, senza Flash Attention
SchedaMemoriaGenerazione (tok/s)Lettura del prompt (tok/s)
RTX 2060 Super8 GB60,01 420
RTX 2070 Super8 GB88,12 088
RTX 3060 12 GB12 GB75,62 138
RTX 2080 Ti11 GB107,52 891

Due insegnamenti. Primo, la 2070 Super genera più velocemente di una RTX 3060 12 GB (88,1 contro 75,6 token al secondo, cioè circa il 17% di differenza): la velocità non è ciò che giustifica la sua sostituzione. Secondo, la RTX 2060 Super ha la stessa larghezza di banda di 448 GB/s della 2070 Super, ma raggiunge 60 token al secondo, cioè il 32% in meno. Un limite massimo di larghezza di banda non è quindi una previsione: contano anche lo stato dei driver, le frequenze e le specifiche della scheda. Considera questi valori come ordini di grandezza.

#Dal modello di prova a un modello attuale: la regola del tre

Il modello di test pesa 3,82 GB (3,56 GiB). Poiché la generazione è limitata dalla lettura dei pesi, un modello più pesante è proporzionalmente più lento, a parità di altre condizioni. Per Granite 4.2 8B in Q4 (4,6 GB), si ottiene al massimo 88 × 3,82 ÷ 4,6, cioè circa 73 token al secondo; per Qwen 3.5 9B in Q4 (6 GB), circa 56 token al secondo. Sono limiti superiori teorici, non misure: le architetture recenti (modelli ibridi, miscele di esperti) e la lunghezza del contesto possono modificare il risultato in un senso o nell'altro.

Questa regola ha un'applicazione pratica. Se un valore dichiarato per la tua configurazione è molto inferiore a questi ordini di grandezza, ad esempio meno di 15 token al secondo su un 8B in Q4, è un segno che parte del modello è stata trasferita nella RAM di sistema: verifica l'occupazione della VRAM prima di dare la colpa alla scheda. La guida alla risoluzione dei problemi di Ollama descrive la procedura da seguire.

#Contesto e cache KV: dove entrano in gioco gli 8 GB

Il throughput diminuisce quando la conversazione si allunga, perché il modello rilegge anche la cache a ogni token. Su una scheda da 8 GB, il calo rimane moderato, dell'ordine di qualche punto percentuale nelle misurazioni pubbliche disponibili per schede simili. Il secondo effetto riguarda la memoria: la cache K/V occupa VRAM in proporzione al contesto. Due impostazioni di Ollama alleggeriscono il carico su una scheda da 8 GB. Flash Attention riduce la memoria consumata quando il contesto aumenta, e la documentazione di Ollama precisa che la cache K/V può essere quantizzata quando Flash Attention è attiva. Il tipo q8_0 utilizza circa la metà della memoria del formato f16 predefinito, con una perdita di precisione molto ridotta secondo la documentazione.

  1. 01
    Attivare Flash Attention
    Avvia il server con la variabile OLLAMA_FLASH_ATTENTION=1. Ollama attiva già automaticamente Flash Attention quando la scheda e il modello lo consentono; la variabile serve a forzarne l'attivazione.
  2. 02
    Quantizzare la cache K/V
    Aggiungi OLLAMA_KV_CACHE_TYPE=q8_0. Passa a q4_0 solo come ultima risorsa: la documentazione segnala un possibile peggioramento con contesti lunghi.
  3. 03
    Verificare l'utilizzo della memoria
    Invia un prompt lungo e controlla la memoria della scheda con nvidia-smi: se la VRAM si satura, riduci il contesto invece di lasciare che Ollama trasferisca parte del modello nella RAM.
Linux: avviare Ollama con i due parametri
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Sulla 2070 Super, il test di llama.cpp con Flash Attention dà 87,7 token al secondo in generazione contro 88,1 senza: qui non c’è da aspettarsi alcun aumento di velocità. La lettura del prompt passa invece da 2.088 a 2.293 token al secondo, un aspetto importante per i documenti lunghi e il RAG. Per approfondire l’argomento, un’intera guida è dedicata alla quantizzazione della cache.

#Turing nel 2026: driver, supporto e limiti

Le schede Turing continuano a essere supportate. La documentazione di Ollama richiede una capacità di calcolo di almeno 5.0 e un driver 550 o più recente; le RTX 2070, 2080 e 2080 Ti figurano nel suo elenco di schede con capacità di calcolo 7.5. Turing è persino diventata l'architettura minima supportata: le note di rilascio di CUDA 13 indicano che il supporto alle architetture precedenti a Turing (Maxwell, Volta e Pascal) è stato abbandonato. Nulla permette di stabilire una data per la fine del supporto a Turing, e sarebbe azzardato annunciarne una; per prudenza, occorre consultare queste note di rilascio a ogni aggiornamento importante di CUDA.

Una limitazione pratica rimane: i modelli recenti vengono spesso pubblicati inizialmente in formati pensati per hardware più nuovo, e la comunità propone poi conversioni GGUF in Q4 per schede come la tua. Questo non blocca Ollama o llama.cpp, ma può ritardare di un giorno o due l'arrivo di un modello in un formato leggibile.

#2070 Super, 3060 12 GB o 3060 Ti: quale scelta fare?

Tre schede da 8 a 12 GB per l'uso LLM
SchedaMemoriaGenerazione (tok/s)Cosa offre
RTX 2070 Super8 GB88,1Velocità discreta; limite di 9B in Q4
RTX 3060 Ti8 GB92,2Un po' più veloce; stesso limite di capacità
RTX 3060 12 GB12 GB75,6Più lenta, ma con 4 GB in più: Gemma 4 12B in Q4 con margine

A velocità comparabili, la capacità è decisiva. Passare da una 2070 Super a una 3060 Ti non cambia il limite di 9B; passare a una 3060 da 12 GB permette di usare modelli da 12 miliardi e contesti lunghi, al prezzo di un throughput leggermente inferiore. I prezzi dell'usato cambiano ogni settimana: consulta il monitoraggio del sito prima di decidere.

#Verdetto 2026: tenere, acquistare o passare a qualcosa di diverso

Tienila se
Usi un assistente da 7 a 9B in Q4 per codice breve, riassunti o RAG moderato. La velocità di generazione è molto soddisfacente e nulla richiede di cambiare.
Passa ad altro se
Vuoi un 12B con un vero contesto, un modello da 14B o più, oppure documenti molto lunghi. In tal caso servono almeno 12 GB, e 16 GB per stare tranquillo.
Quando acquisti una scheda usata
Una 2070 Super è interessante solo se il suo prezzo resta nettamente inferiore a quello di una scheda da 12 GB. Controlla la garanzia e lo stato della ventola: queste schede hanno diversi anni di utilizzo.

#Domande frequenti

Domande frequenti
La RTX 2070 può eseguire un LLM nel 2026?+
Sì, entro il limite dei suoi 8 GB. Un modello da 7 a 9 miliardi di parametri in Q4, come Granite 4.2 8B o Qwen 3.5 9B, trova interamente spazio nella memoria della scheda. Nel test di riferimento di llama.cpp, la 2070 Super genera 88 token al secondo, una velocità più che sufficiente per una chat o per ricevere aiuto con il codice.
RTX 2070 o RTX 2070 Super per un LLM?+
Entrambe hanno 8 GB di GDDR6 e la stessa larghezza di banda di 448 GB/s, e la generazione dipende soprattutto dalla larghezza di banda. La Super, con più core, aiuta soprattutto nella lettura dei prompt lunghi. Se la differenza di prezzo è significativa, la 2070 standard offre un'esperienza di generazione molto simile.
È possibile eseguire Gemma 4 12B su una RTX 2070?+
È al limite. Il catalogo indica 7 GB di pesi in Q4, il che lascia pochissimo spazio per la cache del contesto e il sistema su 8 GB. Il modello si carica, ma parte dei dati viene presto trasferita nella RAM di sistema non appena la conversazione si allunga. Preferisci Granite 4.2 8B o Qwen 3.5 9B, oppure passa a 12 GB di VRAM.
Quanti token al secondo su una RTX 2070 Super?+
La tabella pubblica di llama.cpp indica 88 token al secondo per Llama 2 7B in Q4_0. Un modello più pesante sarà più lento, con un rallentamento approssimativamente proporzionale alle sue dimensioni: come stima teorica, considera una velocità dell'ordine di 55–75 token al secondo per un modello da 8–9B in Q4. Un contesto lungo riduce questo valore.
I driver attuali supportano ancora la RTX 2070?+
Sì. Ollama elenca le RTX 2070, 2080 e 2080 Ti tra le schede con capacità di calcolo 7.5 e richiede semplicemente un driver 550 o successivo. CUDA 13 ha persino fissato Turing come architettura minima supportata, abbandonando le architetture precedenti. Nelle fonti consultate non è annunciata alcuna fine del supporto.
Conviene attivare Flash Attention su una RTX 2070?+
Ollama l'attiva automaticamente quando l'hardware lo permette; puoi forzarla con OLLAMA_FLASH_ATTENTION=1. Sulla 2070 Super, non cambia la velocità di generazione, ma accelera la lettura del prompt di circa il 10% e riduce la memoria utilizzata con contesti lunghi, cosa importante con 8 GB.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.