Quale LLM su RTX 4070 / 4070 Super / 4070 Ti (12 GB) ?
Una RTX 4070, 4070 Super o 4070 Ti offre 12 GB di VRAM e 504 GB/s di banda passante: abbastanza per far girare in Q4 i modelli fino a 14 miliardi di parametri (Qwen 3.5 9B, Gemma 4 12B, Qwen3 14B), non per quelli da 24 a 27 miliardi. Le tre schede generano quasi alla stessa velocità, poiché la loro memoria è identica; cambia soltanto la lettura dei prompt lunghi.
Le tre schede della famiglia RTX 4070 condividono la stessa memoria, ma non la stessa potenza di calcolo, e questa differenza conta meno di quanto si creda per un LLM. Questa guida elenca i modelli che rientrano davvero in 12 GB, con le loro dimensioni esatte, la memoria da prevedere per il contesto, le velocità misurate da terzi e la procedura da seguire per i modelli troppo grandi. Saprai anche quale variante cercare sul mercato dell'usato e quando passare a 16 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5070 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 4070 e LLM locale: cosa permettono 12 GB
Per un LLM locale, una RTX 4070 vale soprattutto per i suoi 12 GB di memoria e i suoi 504 GB/s di larghezza di banda: questi due numeri determinano quali modelli ci stanno e a quale velocità funzionano. I modelli da 7 a 14 miliardi di parametri in Q4 stanno interamente in VRAM: secondo la libreria di Ollama, Qwen 3.5 9B pesa 6,6 GB, Gemma 4 12B 7,6 GB e Qwen3 14B 9,3 GB. Hardware Corner misura 71 token al secondo su Qwen3 8B e 42 su Qwen3 14B con un contesto di 4.000 token su una RTX 4070. I modelli da 24 a 27 miliardi di parametri, come Mistral Small 24B (14 GB) o Qwen 3.8 27B (18 GB), non stanno interamente in VRAM: una parte viene caricata nella RAM di sistema e la velocità cala. Le varianti Super e Ti non aggiungono alcuna larghezza di banda.
- Uscite
- 4070 Ti il 5 gennaio 2023, 4070 il 13 aprile 2023, 4070 Super il 17 gennaio 2024, secondo Wikipedia.
- Memoria
- 12 GB di GDDR6X, bus da 192 bit a 21 Gbit/s: 192 × 21 ÷ 8 = 504 GB/s, valore rilevato da Puget Systems per le tre schede.
- Core CUDA
- 5 888 per la 4070, 7 168 per la Super, 7 680 per la Ti, secondo NVIDIA.
- Consumo
- 200, 220 e 285 W di potenza grafica; alimentatore richiesto da 650, 650 e 700 W, secondo NVIDIA.
#4070, Super o Ti: stessa memoria, diversa potenza di calcolo
| Scheda | Core CUDA | Larghezza di banda | FP16 (TFLOPS) | Potenza grafica | Alimentazione richiesta |
|---|---|---|---|---|---|
| RTX 4070 | 5 888 | 504 GB/s | 29,15 | 200 W | 650 W |
| RTX 4070 Super | 7 168 | 504 GB/s | 35,48 | 220 W | 650 W |
| RTX 4070 Ti | 7 680 | 504 GB/s | 40,09 | 285 W | 700 W |
Per generare un token, la GPU rilegge tutti i pesi attivi del modello: la velocità di generazione è limitata dalla larghezza di banda della memoria, non dal numero di core. Le tre schede hanno però la stessa larghezza di banda: 504,2 GB/s. Puget ha testato Phi-3-mini in GGUF a 4 bit con llama.cpp: la differenza del 25% tra la 4070 e la 4070 Ti durante la lettura del prompt si riduce, nella generazione, a punteggi quasi identici. Hardware Corner, con altri modelli, classifica la Super al 114% e la Ti al 116% rispetto alla 4070. La differenza reale va quindi da quasi nulla a circa il 15%, mentre i core CUDA aumentano dal 22% al 30%.
La potenza di calcolo serve a leggere il prompt, la fase che precede la prima parola. In FP16, secondo Puget, la Super offre il 22% di TFLOPS in più rispetto alla 4070 e la Ti il 38% in più. Questo conta per un RAG, un documento lungo o un agente di programmazione che invia prompt molto lunghi: il tempo di attesa prima della risposta si riduce. Una chat breve ne trae ben poco beneficio.
#I modelli che rientrano in 12 GB
Le dimensioni sono quelle dei file della libreria Ollama consultati il 29 settembre 2026. Il margine è ciò che resta dei 12 GB prima di tenere conto di contesto, cache e buffer del motore.
| Modello | File Ollama | Margine lordo | A che scopo |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 6,7 GB | RAG e chiamata di strumenti, 128K di contesto, Apache 2.0 |
| Qwen 3.5 9B (Q4_K_M) | 6,6 GB | 5,4 GB | Polivalente, testo e immagini, Apache 2.0 |
| Gemma 4 12B (Q4_K_M) | 7,6 GB | 4,4 GB | Testo, immagine, audio; versione QAT da 7,2 GB |
| Qwen3 14B | 9,3 GB | 2,7 GB | Il più grande modello denso eseguibile senza difficoltà |
| Qwen 3.5 9B (Q8_0) | 11 GB | 1 GB | Da evitare: margine troppo ridotto per il contesto e i buffer |
Qwen 3.5 9B è il punto di partenza più sicuro. Gemma 4 12B, con 11,95 miliardi di parametri secondo Google, subentra se vuoi anche audio e immagini. Granite 4.2 8B è adatto alla ricerca documentale, per la quale IBM mette in evidenza il RAG e la chiamata di strumenti. Qwen3 14B è il limite superiore: 2,7 GB di margine bastano per qualche migliaio di token di contesto. La versione Q8_0 di Qwen 3.5 9B lascia solo un GB: contesto, buffer e memoria occupata da Windows possono farle superare la memoria disponibile sulla GPU.
Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, cioè 6,5 GB in totale con Granite 4.2 8B e 8,8 GB con Gemma 4 12B.
#Il contesto: la memoria che rimane dopo il modello
Ollama regola il contesto in base alla memoria video: la documentazione indica 4k token per impostazione predefinita con meno di 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, gli strumenti di programmazione e la ricerca web. Una RTX 4070 rientra nella fascia 4k: un agente avviato con le impostazioni predefinite perde la cronologia molto prima che la memoria della scheda sia piena. Aumentare il contesto richiede VRAM, sotto forma di cache KV, che memorizza le chiavi e i valori di attenzione di ogni token già letto.
La sua dimensione si calcola così: 2 (chiavi e valori) × strati con attenzione completa × teste KV × dimensione di una testa × byte per valore × numero di token. Secondo la sua scheda Hugging Face, Qwen 3.5 9B ha solo 8 strati con attenzione completa su 32, con 4 teste KV di dimensione 256. Gemma 4 12B combina strati con una finestra scorrevole di 1.024 token e strati globali con chiavi e valori unificati. La loro cache pesa molto meno di quella di un transformer classico.
| Modello | 8.000 token | 32 000 token | 128 000 token |
|---|---|---|---|
| Qwen 3.5 9B | 0,25 | 1,0 | 4,0 |
| Gemma 4 12B | 0,4 | 0,6 à 0,8 | 1,3 à 2,3 |
| Transformer classico (32 strati, 8 teste KV di dimensione 128, esempio) | 1,0 | 4,0 | 16,0 |
Sono stime teoriche, non misure: non tengono conto dei buffer di calcolo, dello stato degli strati DeltaNet e dell'encoder di immagini, e l'intervallo di Gemma deriva dall'incertezza sulla condivisione di chiavi e valori. Qwen 3.5 9B (6,6 GB) con 32.000 token lascia circa 4,4 GB; a 128.000 token, la sola cache raggiunge 4 GiB e il totale sfiora i 12 GB. Controlla il risultato reale con ollama ps.
La leva successiva è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16 con una perdita di precisione molto ridotta e richiede Flash Attention, che Ollama attiva automaticamente quando la scheda e il modello la supportano. Un contesto lungo rallenta anche la generazione: Hardware Corner passa da 71 a 52 e poi a 38 token al secondo passando da 4k a 16k e a 32k con Qwen3 8B.
#Installare Ollama e verificare che il modello rientri nella memoria disponibile
Su Windows, Ollama richiede un driver NVIDIA 551.61 o successivo secondo la documentazione, e la serie 4070 figura tra le schede supportate. Il processo installa un modello e verifica che funzioni al 100% sulla scheda.
- 01Verificare il driverApri l'applicazione NVIDIA o esegui nvidia-smi in un terminale: il driver deve essere alla versione 551.61 o successiva.
- 02Installare OllamaScarica il programma per Windows dal sito di Ollama. L'API locale ascolta quindi su http://localhost:11434.
- 03Avviare un modelloApri un terminale e esegui ollama run qwen3.5:9b. Il download di 6,6 GB avviene una sola volta.
- 04Controllare la distribuzione della memoriaIn un secondo terminale, esegui ollama ps. La colonna Processore deve mostrare 100 % GPU. Una ripartizione del tipo 48 % / 52 % CPU/GPU significa che il modello viene caricato in parte nella RAM di sistema.
- 05Regolare il contesto e la cacheAumenta il contesto nelle impostazioni dell'applicazione Ollama o con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se il margine non basta, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio del server.
- Installare Ollama su Windows 11: guida completa
- Risolvere i problemi di Ollama: GPU non rilevata, lentezza, errori di memoria
#Velocità misurate da terzi e limite teorico
QuelLLM non pubblica qui misure interne: ogni velocità proviene da una fonte esterna, con il suo modello e il suo contesto. Hardware Corner ha misurato una RTX 4070 nel marzo 2026; XDA ha pubblicato nel giugno 2026 un test su una 4070 Ti.
| Fonte | Scheda | Modello | Contesto | Generazione | Lettura del prompt |
|---|---|---|---|---|---|
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 4k | 71,2 | 3 564 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 16k | 52,1 | 2 064 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 32k | 38,1 | 1 117 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 4k | 42,5 | 2 100 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 16k | 32,7 | 1 356 |
| XDA | RTX 4070 Ti | Qwen 3.5 9B (Ollama) | non specificato | 65 à 67 | non specificato |
Un limite teorico aiuta a valutare questi numeri: la generazione non può superare la banda passante divisa per il peso del modello. Per Qwen3 8B (5,2 GB su Ollama), 504 ÷ 5,2 dà circa 97 token al secondo; il valore misurato a 4k, 71,2, ne raggiunge il 73 %. Qwen3 14B (9,3 GB) ha un limite di 54 e un valore misurato di 42,5, pari al 78 %. XDA rileva da 65 a 67 su Qwen 3.5 9B (limite 76), pari all'85–88 %. Per Gemma 4 12B (7,6 GB, limite 66), questo intervallo dal 73 all'88 % dà da 48 a 58 token al secondo: una stima, non una misura.
| Scheda | Larghezza di banda | Generazione (t/s) |
|---|---|---|
| RTX 4060 Ti 8 GB | 288 GB/s | 64,03 |
| RTX 5070 12 GB | 672 GB/s | 128,21 |
| RTX 4070 Ti Super 16 GB | 672 GB/s | 132,85 |
| RTX 3080 10 GB | 760 GB/s | 139,95 |
Queste righe provengono dalla classifica della comunità di llama.cpp, in cui non compare alcuna RTX 4070. La velocità di generazione segue la larghezza di banda: due schede da 672 GB/s, una da 12 GB e l'altra da 16 GB, vanno più o meno alla stessa velocità; la 4060 Ti, da 288 GB/s, va alla metà della velocità. Con una proporzione, una 4070 da 504 GB/s darebbe circa 99 token al secondo su questo modello da 3,56 GiB: una stima, non una misura.
#Al di sopra di 12 GB: Qwen 3.8, Mistral Small, gpt-oss
Qwen 3.8 è disponibile nella libreria Ollama solo nella versione da 27 miliardi di parametri, che occupa 18 GB in Q4_K_M: supera di 6 GB la memoria di una RTX 4070 e sarebbe distribuito tra la scheda e la RAM. Essendo denso, ogni token rilegge tutti i pesi. Con 11 GB sulla scheda a 504 GB/s e 7 GB in RAM a 60 GB/s (ipotesi per una DDR5 a doppio canale), un token richiede 22 ms sulla GPU e 117 ms in RAM: il limite massimo scende a circa 7 token al secondo, contro 76 per Qwen 3.5 9B.
| Modello | File Ollama | Eccesso | Natura | Percorso possibile |
|---|---|---|---|---|
| Mistral Small 24B | 14 GB | 2 GB | Dense | Non consigliato: denso |
| gpt-oss 20B | 14 GB | 2 GB | MoE, 3,6 miliardi attivi | Esperti in offload (llama.cpp) |
| Gemma 4 26B | 19 GB | 7 GB | MoE (A4B) | Lo stesso, da misurare da sé |
| Qwen 3.8 27B | 18 GB | 6 GB | Dense | No: troppo lento |
I modelli a esperti si prestano meglio al trasferimento di parte del modello nella RAM di sistema. gpt-oss 20B conta 21 miliardi di parametri, di cui 3,6 miliardi attivi per token, secondo la sua scheda. L'opzione --n-cpu-moe di llama.cpp mantiene nella RAM gli esperti dei primi N livelli, mentre l'attenzione e la cache restano sulla scheda. La guida ufficiale di llama.cpp per gpt-oss fornisce un esempio su una RTX 2060 da 8 GB: 16 livelli di esperti sulla CPU per 32.000 token di contesto. Con 12 GB, riduci N gradualmente fino a incontrare un errore di memoria, poi aumentalo di un passo.
Non abbiamo trovato misurazioni di questo metodo su una RTX 4070 corredate da una fonte: il throughput dipende dalla tua RAM e da N e va misurato da te. Nell'agosto 2025 un utente riportava circa 10 token al secondo con gpt-oss 20B su una RTX 4070 in Ollama, con una ripartizione automatica del 47% sulla CPU e del 53% sulla GPU; la versione e l'impostazione potrebbero essere cambiate da allora.
#Verdetto: quale 4070 e quando passare a 16 GB
| Situazione | Decisione | Motivazione supportata da dati numerici |
|---|---|---|
| Hai già una 4070, Super o Ti | Tenerla per i modelli da 7 a 14 miliardi | Stessa banda passante, differenza nella generazione dallo 0 al 16% |
| Chat, assistente, programmazione leggera | La 4070 di base basta | Generazione legata alla banda passante |
| RAG, documenti voluminosi, agenti | La Super, altrimenti la Ti | +22 % e +38 % di TFLOPS FP16 |
| Vuoi un 24B interamente in VRAM (14 GB) | Passare a 16 GB (4070 Ti Super) | 16 GB e 672 GB/s |
| Vuoi andare più veloce con 12 GB | Una RTX 5070 | 672 GB/s contro 504, cioè il 33 % in più |
La RTX 5070 migliora la velocità, non la capacità: NVIDIA la dota di 12 GB di GDDR7 su un bus da 192 bit, cioè 672 GB/s a 28 Gbit/s contro 504 per la 4070. Per far stare in memoria un modello più grande, sono i 16 GB a contare. Le guide sulla 5070 e sulla 4070 Ti Super descrivono in dettaglio ogni caso.
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
- Fonte: NVIDIA, specifiche della famiglia RTX 4070
- Fonte: Puget Systems, prestazioni LLM delle GPU consumer
- Fonte: documentazione di Ollama, lunghezza del contesto
- Fonte: FAQ di Ollama, Flash Attention e cache KV
- Fonte: guida llama.cpp per eseguire gpt-oss
#Domande frequenti
Quale modello installare su una RTX 4070?+
Qwen 3.8 funziona su una RTX 4070?+
RTX 4070, 4070 Super o 4070 Ti: quale per un LLM locale?+
12 GB sono ancora sufficienti per un LLM nel 2026?+
Quale alimentatore per una RTX 4070 Super?+
RTX 4070 o RTX 3080 10 GB per i LLM?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.