Intermedio 14 minRTX 40

Quale LLM su RTX 4070 / 4070 Super / 4070 Ti (12 GB) ?

Risposta diretta

Una RTX 4070, 4070 Super o 4070 Ti offre 12 GB di VRAM e 504 GB/s di banda passante: abbastanza per far girare in Q4 i modelli fino a 14 miliardi di parametri (Qwen 3.5 9B, Gemma 4 12B, Qwen3 14B), non per quelli da 24 a 27 miliardi. Le tre schede generano quasi alla stessa velocità, poiché la loro memoria è identica; cambia soltanto la lettura dei prompt lunghi.

Le tre schede della famiglia RTX 4070 condividono la stessa memoria, ma non la stessa potenza di calcolo, e questa differenza conta meno di quanto si creda per un LLM. Questa guida elenca i modelli che rientrano davvero in 12 GB, con le loro dimensioni esatte, la memoria da prevedere per il contesto, le velocità misurate da terzi e la procedura da seguire per i modelli troppo grandi. Saprai anche quale variante cercare sul mercato dell'usato e quando passare a 16 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5070 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 4070 e LLM locale: cosa permettono 12 GB

Per un LLM locale, una RTX 4070 vale soprattutto per i suoi 12 GB di memoria e i suoi 504 GB/s di larghezza di banda: questi due numeri determinano quali modelli ci stanno e a quale velocità funzionano. I modelli da 7 a 14 miliardi di parametri in Q4 stanno interamente in VRAM: secondo la libreria di Ollama, Qwen 3.5 9B pesa 6,6 GB, Gemma 4 12B 7,6 GB e Qwen3 14B 9,3 GB. Hardware Corner misura 71 token al secondo su Qwen3 8B e 42 su Qwen3 14B con un contesto di 4.000 token su una RTX 4070. I modelli da 24 a 27 miliardi di parametri, come Mistral Small 24B (14 GB) o Qwen 3.8 27B (18 GB), non stanno interamente in VRAM: una parte viene caricata nella RAM di sistema e la velocità cala. Le varianti Super e Ti non aggiungono alcuna larghezza di banda.

Uscite
4070 Ti il 5 gennaio 2023, 4070 il 13 aprile 2023, 4070 Super il 17 gennaio 2024, secondo Wikipedia.
Memoria
12 GB di GDDR6X, bus da 192 bit a 21 Gbit/s: 192 × 21 ÷ 8 = 504 GB/s, valore rilevato da Puget Systems per le tre schede.
Core CUDA
5 888 per la 4070, 7 168 per la Super, 7 680 per la Ti, secondo NVIDIA.
Consumo
200, 220 e 285 W di potenza grafica; alimentatore richiesto da 650, 650 e 700 W, secondo NVIDIA.
!
Controlla il tipo di memoria di una 4070 usata
Da agosto 2024 esiste anche una RTX 4070 con GDDR6 a 20 Gbit/s invece che GDDR6X, secondo Wikipedia. Sullo stesso bus da 192 bit, si ottengono 480 GB/s invece di 504, cioè il 5 % in meno. Chiedi il codice esatto del modello.

#4070, Super o Ti: stessa memoria, diversa potenza di calcolo

Le tre RTX 4070 da 12 GB a confronto (NVIDIA, Puget Systems)
SchedaCore CUDALarghezza di bandaFP16 (TFLOPS)Potenza graficaAlimentazione richiesta
RTX 40705 888504 GB/s29,15200 W650 W
RTX 4070 Super7 168504 GB/s35,48220 W650 W
RTX 4070 Ti7 680504 GB/s40,09285 W700 W

Per generare un token, la GPU rilegge tutti i pesi attivi del modello: la velocità di generazione è limitata dalla larghezza di banda della memoria, non dal numero di core. Le tre schede hanno però la stessa larghezza di banda: 504,2 GB/s. Puget ha testato Phi-3-mini in GGUF a 4 bit con llama.cpp: la differenza del 25% tra la 4070 e la 4070 Ti durante la lettura del prompt si riduce, nella generazione, a punteggi quasi identici. Hardware Corner, con altri modelli, classifica la Super al 114% e la Ti al 116% rispetto alla 4070. La differenza reale va quindi da quasi nulla a circa il 15%, mentre i core CUDA aumentano dal 22% al 30%.

La potenza di calcolo serve a leggere il prompt, la fase che precede la prima parola. In FP16, secondo Puget, la Super offre il 22% di TFLOPS in più rispetto alla 4070 e la Ti il 38% in più. Questo conta per un RAG, un documento lungo o un agente di programmazione che invia prompt molto lunghi: il tempo di attesa prima della risposta si riduce. Una chat breve ne trae ben poco beneficio.

→
La Ti si giustifica raramente
Consuma 285 W contro i 220 W della Super, cioè il 30% in più, per ottenere 2 punti in più nella generazione secondo Hardware Corner, ed è la più vecchia delle tre. A parità circa di prezzo, la Super è il miglior acquisto della famiglia.

#I modelli che rientrano in 12 GB

Le dimensioni sono quelle dei file della libreria Ollama consultati il 29 settembre 2026. Il margine è ciò che resta dei 12 GB prima di tenere conto di contesto, cache e buffer del motore.

Modelli testabili su RTX 4070, Super o Ti (file Ollama)
ModelloFile OllamaMargine lordoA che scopo
Granite 4.2 8B5,3 GB6,7 GBRAG e chiamata di strumenti, 128K di contesto, Apache 2.0
Qwen 3.5 9B (Q4_K_M)6,6 GB5,4 GBPolivalente, testo e immagini, Apache 2.0
Gemma 4 12B (Q4_K_M)7,6 GB4,4 GBTesto, immagine, audio; versione QAT da 7,2 GB
Qwen3 14B9,3 GB2,7 GBIl più grande modello denso eseguibile senza difficoltà
Qwen 3.5 9B (Q8_0)11 GB1 GBDa evitare: margine troppo ridotto per il contesto e i buffer

Qwen 3.5 9B è il punto di partenza più sicuro. Gemma 4 12B, con 11,95 miliardi di parametri secondo Google, subentra se vuoi anche audio e immagini. Granite 4.2 8B è adatto alla ricerca documentale, per la quale IBM mette in evidenza il RAG e la chiamata di strumenti. Qwen3 14B è il limite superiore: 2,7 GB di margine bastano per qualche migliaio di token di contesto. La versione Q8_0 di Qwen 3.5 9B lascia solo un GB: contesto, buffer e memoria occupata da Windows possono farle superare la memoria disponibile sulla GPU.

Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, cioè 6,5 GB in totale con Granite 4.2 8B e 8,8 GB con Gemma 4 12B.

#Il contesto: la memoria che rimane dopo il modello

Ollama regola il contesto in base alla memoria video: la documentazione indica 4k token per impostazione predefinita con meno di 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, gli strumenti di programmazione e la ricerca web. Una RTX 4070 rientra nella fascia 4k: un agente avviato con le impostazioni predefinite perde la cronologia molto prima che la memoria della scheda sia piena. Aumentare il contesto richiede VRAM, sotto forma di cache KV, che memorizza le chiavi e i valori di attenzione di ogni token già letto.

La sua dimensione si calcola così: 2 (chiavi e valori) × strati con attenzione completa × teste KV × dimensione di una testa × byte per valore × numero di token. Secondo la sua scheda Hugging Face, Qwen 3.5 9B ha solo 8 strati con attenzione completa su 32, con 4 teste KV di dimensione 256. Gemma 4 12B combina strati con una finestra scorrevole di 1.024 token e strati globali con chiavi e valori unificati. La loro cache pesa molto meno di quella di un transformer classico.

Dimensione stimata della cache KV in f16 (GiB), calcolata in base alla configurazione pubblicata
Modello8.000 token32 000 token128 000 token
Qwen 3.5 9B0,251,04,0
Gemma 4 12B0,40,6 à 0,81,3 à 2,3
Transformer classico (32 strati, 8 teste KV di dimensione 128, esempio)1,04,016,0

Sono stime teoriche, non misure: non tengono conto dei buffer di calcolo, dello stato degli strati DeltaNet e dell'encoder di immagini, e l'intervallo di Gemma deriva dall'incertezza sulla condivisione di chiavi e valori. Qwen 3.5 9B (6,6 GB) con 32.000 token lascia circa 4,4 GB; a 128.000 token, la sola cache raggiunge 4 GiB e il totale sfiora i 12 GB. Controlla il risultato reale con ollama ps.

La leva successiva è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16 con una perdita di precisione molto ridotta e richiede Flash Attention, che Ollama attiva automaticamente quando la scheda e il modello la supportano. Un contesto lungo rallenta anche la generazione: Hardware Corner passa da 71 a 52 e poi a 38 token al secondo passando da 4k a 16k e a 32k con Qwen3 8B.

#Installare Ollama e verificare che il modello rientri nella memoria disponibile

Su Windows, Ollama richiede un driver NVIDIA 551.61 o successivo secondo la documentazione, e la serie 4070 figura tra le schede supportate. Il processo installa un modello e verifica che funzioni al 100% sulla scheda.

  1. 01
    Verificare il driver
    Apri l'applicazione NVIDIA o esegui nvidia-smi in un terminale: il driver deve essere alla versione 551.61 o successiva.
  2. 02
    Installare Ollama
    Scarica il programma per Windows dal sito di Ollama. L'API locale ascolta quindi su http://localhost:11434.
  3. 03
    Avviare un modello
    Apri un terminale e esegui ollama run qwen3.5:9b. Il download di 6,6 GB avviene una sola volta.
  4. 04
    Controllare la distribuzione della memoria
    In un secondo terminale, esegui ollama ps. La colonna Processore deve mostrare 100 % GPU. Una ripartizione del tipo 48 % / 52 % CPU/GPU significa che il modello viene caricato in parte nella RAM di sistema.
  5. 05
    Regolare il contesto e la cache
    Aumenta il contesto nelle impostazioni dell'applicazione Ollama o con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se il margine non basta, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio del server.
Comandi di base
ollama run qwen3.5:9b
ollama run gemma4:12b
ollama ps

# Exemple de la documentation Ollama pour fixer le contexte à 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocità misurate da terzi e limite teorico

QuelLLM non pubblica qui misure interne: ogni velocità proviene da una fonte esterna, con il suo modello e il suo contesto. Hardware Corner ha misurato una RTX 4070 nel marzo 2026; XDA ha pubblicato nel giugno 2026 un test su una 4070 Ti.

Velocità pubblicate su RTX 4070 e 4070 Ti (token al secondo)
FonteSchedaModelloContestoGenerazioneLettura del prompt
Hardware CornerRTX 4070Qwen3 8B Q4_K4k71,23 564
Hardware CornerRTX 4070Qwen3 8B Q4_K16k52,12 064
Hardware CornerRTX 4070Qwen3 8B Q4_K32k38,11 117
Hardware CornerRTX 4070Qwen3 14B Q4_K4k42,52 100
Hardware CornerRTX 4070Qwen3 14B Q4_K16k32,71 356
XDARTX 4070 TiQwen 3.5 9B (Ollama)non specificato65 à 67non specificato

Un limite teorico aiuta a valutare questi numeri: la generazione non può superare la banda passante divisa per il peso del modello. Per Qwen3 8B (5,2 GB su Ollama), 504 ÷ 5,2 dà circa 97 token al secondo; il valore misurato a 4k, 71,2, ne raggiunge il 73 %. Qwen3 14B (9,3 GB) ha un limite di 54 e un valore misurato di 42,5, pari al 78 %. XDA rileva da 65 a 67 su Qwen 3.5 9B (limite 76), pari all'85–88 %. Per Gemma 4 12B (7,6 GB, limite 66), questo intervallo dal 73 all'88 % dà da 48 a 58 token al secondo: una stima, non una misura.

Generazione su llama.cpp in base alla banda passante (Llama 2 7B Q4_0, test tg128, Flash Attention attivata)
SchedaLarghezza di bandaGenerazione (t/s)
RTX 4060 Ti 8 GB288 GB/s64,03
RTX 5070 12 GB672 GB/s128,21
RTX 4070 Ti Super 16 GB672 GB/s132,85
RTX 3080 10 GB760 GB/s139,95

Queste righe provengono dalla classifica della comunità di llama.cpp, in cui non compare alcuna RTX 4070. La velocità di generazione segue la larghezza di banda: due schede da 672 GB/s, una da 12 GB e l'altra da 16 GB, vanno più o meno alla stessa velocità; la 4060 Ti, da 288 GB/s, va alla metà della velocità. Con una proporzione, una 4070 da 504 GB/s darebbe circa 99 token al secondo su questo modello da 3,56 GiB: una stima, non una misura.

#Al di sopra di 12 GB: Qwen 3.8, Mistral Small, gpt-oss

Qwen 3.8 è disponibile nella libreria Ollama solo nella versione da 27 miliardi di parametri, che occupa 18 GB in Q4_K_M: supera di 6 GB la memoria di una RTX 4070 e sarebbe distribuito tra la scheda e la RAM. Essendo denso, ogni token rilegge tutti i pesi. Con 11 GB sulla scheda a 504 GB/s e 7 GB in RAM a 60 GB/s (ipotesi per una DDR5 a doppio canale), un token richiede 22 ms sulla GPU e 117 ms in RAM: il limite massimo scende a circa 7 token al secondo, contro 76 per Qwen 3.5 9B.

Modelli che superano 12 GB (file Ollama)
ModelloFile OllamaEccessoNaturaPercorso possibile
Mistral Small 24B14 GB2 GBDenseNon consigliato: denso
gpt-oss 20B14 GB2 GBMoE, 3,6 miliardi attiviEsperti in offload (llama.cpp)
Gemma 4 26B19 GB7 GBMoE (A4B)Lo stesso, da misurare da sé
Qwen 3.8 27B18 GB6 GBDenseNo: troppo lento

I modelli a esperti si prestano meglio al trasferimento di parte del modello nella RAM di sistema. gpt-oss 20B conta 21 miliardi di parametri, di cui 3,6 miliardi attivi per token, secondo la sua scheda. L'opzione --n-cpu-moe di llama.cpp mantiene nella RAM gli esperti dei primi N livelli, mentre l'attenzione e la cache restano sulla scheda. La guida ufficiale di llama.cpp per gpt-oss fornisce un esempio su una RTX 2060 da 8 GB: 16 livelli di esperti sulla CPU per 32.000 token di contesto. Con 12 GB, riduci N gradualmente fino a incontrare un errore di memoria, poi aumentalo di un passo.

Esempio dalla guida su llama.cpp (scheda da 8 GB): regola --n-cpu-moe
llama-server -hf ggml-org/gpt-oss-20b-GGUF --ctx-size 32768 --jinja -ub 2048 -b 2048 --n-cpu-moe 16

Non abbiamo trovato misurazioni di questo metodo su una RTX 4070 corredate da una fonte: il throughput dipende dalla tua RAM e da N e va misurato da te. Nell'agosto 2025 un utente riportava circa 10 token al secondo con gpt-oss 20B su una RTX 4070 in Ollama, con una ripartizione automatica del 47% sulla CPU e del 53% sulla GPU; la versione e l'impostazione potrebbero essere cambiate da allora.

i
Il fine-tuning QLoRA può essere eseguito con 12 GB
Secondo Unsloth, il minimo assoluto di VRAM in QLoRA 4 bit è di 6 GB per 8 miliardi di parametri e di 8,5 GB per 14 miliardi: un modello da 14B rimane possibile su una 4070, con un batch di 1 e un contesto breve.

#Verdetto: quale 4070 e quando passare a 16 GB

Quale scelta fare in base alla tua situazione
SituazioneDecisioneMotivazione supportata da dati numerici
Hai già una 4070, Super o TiTenerla per i modelli da 7 a 14 miliardiStessa banda passante, differenza nella generazione dallo 0 al 16%
Chat, assistente, programmazione leggeraLa 4070 di base bastaGenerazione legata alla banda passante
RAG, documenti voluminosi, agentiLa Super, altrimenti la Ti+22 % e +38 % di TFLOPS FP16
Vuoi un 24B interamente in VRAM (14 GB)Passare a 16 GB (4070 Ti Super)16 GB e 672 GB/s
Vuoi andare più veloce con 12 GBUna RTX 5070672 GB/s contro 504, cioè il 33 % in più

La RTX 5070 migliora la velocità, non la capacità: NVIDIA la dota di 12 GB di GDDR7 su un bus da 192 bit, cioè 672 GB/s a 28 Gbit/s contro 504 per la 4070. Per far stare in memoria un modello più grande, sono i 16 GB a contare. Le guide sulla 5070 e sulla 4070 Ti Super descrivono in dettaglio ogni caso.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

#Domande frequenti

Quale modello installare su una RTX 4070?+
Inizia con Qwen 3.5 9B: il suo file Ollama da 6,6 GB lascia più di 5 GB di margine per il contesto e gestisce testo e immagini. Gemma 4 12B, da 7,6 GB, aggiunge l'audio. Qwen3 14B, da 9,3 GB, è il modello più grande che si può usare comodamente. Oltre i 14 miliardi di parametri in Q4, parte del modello viene trasferita nella RAM.
Qwen 3.8 funziona su una RTX 4070?+
Non in modo confortevole. Qwen 3.8 esiste solo con 27 miliardi di parametri e occupa 18 GB in Q4_K_M in Ollama, cioè 6 GB in più della capacità della scheda. Distribuito tra VRAM e RAM, raggiunge in teoria un massimo di circa 7 token al secondo. Con 12 GB, preferisci Qwen 3.5 9B o Gemma 4 12B.
RTX 4070, 4070 Super o 4070 Ti: quale per un LLM locale?+
Per la generazione di testo, sono quasi equivalenti: stessa memoria di 12 GB, stessa banda passante di 504 GB/s, differenza compresa tra 0 e 16% secondo le misure citate. La Super vale il costo aggiuntivo se invii prompt lunghi, perché li legge più velocemente. La Ti consuma 285 W per un guadagno minimo.
12 GB sono ancora sufficienti per un LLM nel 2026?+
Sì per i modelli da 7 a 14 miliardi di parametri, adatti alla chat, a semplici attività di programmazione e al RAG. No per quelli da 24 a 27 miliardi in Q4, che pesano da 14 a 18 GB: un modello 24B interamente in VRAM richiede 16 GB. I modelli con esperti in offload restano un'opzione.
Quale alimentatore per una RTX 4070 Super?+
NVIDIA indica un alimentatore richiesto da 650 W per la 4070 e la 4070 Super e da 700 W per la 4070 Ti, con 220 W di potenza grafica per la Super. Sono i valori del produttore per un PC completo: un alimentatore da 550 W non rientra in questa raccomandazione, anche se può bastare per un PC a basso consumo.
RTX 4070 o RTX 3080 10 GB per i LLM?+
La 3080 10 GB ha un bus da 320 bit e una banda di 760 GB/s, contro 504 per la 4070: genera più velocemente finché il modello sta entro i suoi 10 GB. La 4070 offre 2 GB in più, cosa che conta per Gemma 4 12B o Qwen3 14B. Dipende dalla dimensione del modello desiderato.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.