RTX 5070 Ti (16 GB) per LLM locale: modelli e tokens/s
Ci chiediamo tutti quale sia il giusto equilibrio tra VRAM, velocità e costo. La RTX 5070 Ti si colloca proprio al centro della gamma Blackwell: 16 GB di GDDR7, circa 1.400 € a fine settembre 2026, un TGP ragionevole. La vera domanda sulla RTX 5070 Ti per gli LLM in locale è: questa scheda riesce a gestire i modelli che contano nel 2026 — GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B — senza farci rimpiangere di non aver scelto la 5080 o la 5090?
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: RTX 5070 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Perché la 5070 Ti?
Il mercato delle GPU nel 2026 è segmentato in modo molto chiaro: la 5060 Ti 16 GB è lenta con i prompt lunghi, la 5080 costa ≈ 450 € in più a parità di VRAM e la 5090 resta un investimento professionale da ≈ 5.700 € a fine settembre 2026. Tra le due, la 5070 Ti occupa il posto che occupava la 4070 Ti Super un anno fa: 16 GB di VRAM, una buona larghezza di banda della memoria e un prezzo ancora accettabile come budget per un hobby preso sul serio.
Per un LLM locale, ciò che conta prima di tutto è la VRAM (quanto può essere grande il modello che entra in memoria) e la banda passante della memoria (a quale velocità si leggono i pesi per generare ogni token). La 5070 Ti soddisfa entrambi i requisiti senza compromessi significativi.
#Cosa offre davvero la scheda
- VRAM
- 16 GB GDDR7 — la stessa quantità della 5080, la metà rispetto alla 5090, ma soprattutto: GDDR7 e non GDDR6X. L'aumento della banda passante rispetto alla generazione precedente è evidente.
- Banda passante della memoria
- Intorno a 896 GB/s. A titolo di confronto: 504 GB/s sulla 4070 Ti Super, 960 GB/s sulla 5080, 1792 GB/s sulla 5090. La 5070 Ti è più vicina alla 5080 che alla 4070 Ti Super.
- Compute
- Architettura Blackwell, Tensor Cores 5a generazione con supporto FP4. La maggior parte dei motori di inferenza (llama.cpp, vLLM) non li sfrutta ancora nel 2026, ma questo è in corso.
- TGP
- 300 W di potenza nominale TGP. Connettore 12V-2x6 (alimentatore ATX 3.0/3.1 fortemente consigliato).
- PCIe
- PCIe 5.0 x16. Non critico per l'inferenza locale (il modello rimane in VRAM), utile per i caricamenti e il multi-GPU.
- Prezzo osservato
- Tra 880 e 1.050 € per i modelli custom a giugno 2026. Non esiste una FE per questo modello.
#Requisiti della macchina
Niente di strano, ma alcuni punti da verificare prima di investire.
- Alimentazione
- 750 W minimo, 850 W raccomandato se si ha un CPU potente. ATX 3.0/3.1 con connettore nativo 12V-2x6 ideale — un adattatore da 4x8 morsetti funziona ma rimane una fonte di problemi.
- CPU
- Qualsiasi Ryzen 7000/9000 o Intel di 13ª/14ª generazione è più che sufficiente. La CPU non svolge alcun lavoro durante l'inferenza sulla GPU: abbiamo eseguito i benchmark su un 7700X senza colli di bottiglia.
- RAM di sistema
- 32 GB di RAM DDR5 offrono un buon margine. Se prevedi di usare l'offload nella RAM di sistema per modelli > 16 GB (DeepSeek V3.2, Kimi K2), passa a 64 o 128 GB.
- OS
- Windows 11 24H2 e Ubuntu 24.04 LTS supportano il driver 580.x senza problemi. Driver NVIDIA Studio (Windows) o il driver di produzione (Linux) — non serve il Game Ready per Ollama.
#Installazione Ollama + driver
- 01Installare il driver NVIDIA 580.x o successivoSu Windows: NVIDIA App, scegliere il driver Studio. Su Linux: sudo ubuntu-drivers install --gpgpu per Ubuntu, oppure il runfile ufficiale. Verifica con nvidia-smi che la scheda e la VRAM siano effettivamente visibili.
- 02Installare OllamaScarica da ollama.com (programma di installazione per Windows o comando Linux). Il daemon ascolta per impostazione predefinita su http://localhost:11434 e rileva automaticamente la 5070 Ti tramite CUDA.
- 03Verificare che la GPU venga effettivamente utilizzataEseguire ollama run qwen3.5:9b, poi monitorare nvidia-smi dmon -s u in un terminale separato. La colonna sm (utilizzo delle risorse di calcolo) deve salire al 60-95% durante la generazione.
- 04Regolare il contestoPer impostazione predefinita, Ollama carica un contesto di 4096 token. Con 16 GB, si può arrivare a 16k o 32k sui modelli 8B senza problemi. Variabile OLLAMA_CONTEXT_LENGTH o parametro num_ctx nell'API.
#Token/sec su 8B e 14B
I modelli che entrano comodamente in memoria anche con un contesto ampio. Misurazioni effettuate con un prompt di 512 token e 256 token generati, media su 5 esecuzioni.
- Qwen 3.5 9B Q4_K_M
- Circa 90 tok/s in generazione, elaborazione del prompt a 2.800 tok/s. VRAM utilizzata: 6,6 GB. Restano 9 GB per il contesto — un margine confortevole a 32k, e il modello arriva a una finestra di contesto fino a 256k (visione inclusa).
- Granite 4.2 8B Q4_K_M
- Circa 94 tok/s. VRAM utilizzata: 5,3 GB, molto efficiente nell'uso dei token e con un contesto di 128k. L'alternativa parca nei consumi a Qwen quando si vuole il massimo throughput.
- Gemma 4 12B Q4_K_M
- Circa 62 tok/s. VRAM utilizzata: 7,6 GB. È il punto di equilibrio ideale nella fascia media, con un ampio margine sulla scheda: restano 8 GB per il contesto e la cache KV, e Gemma 4 è multimodale (Apache 2.0 da aprile 2026).
- Qwen 3.5 9B Q8_0
- Circa 48 tok/s. VRAM utilizzata: 11 GB. La qualità massima della fascia: lo stesso 9B ma in Q8, quando vuoi i risultati migliori senza cambiare modello.
- Mistral Small 24B Q4_K_M
- Circa 36 tok/s. VRAM utilizzata: 14,2 GB. Ci sta: è un modello generalista valido e buono in francese, ma il contesto è limitato a 8k senza offload — il limite dei 16 GB comincia a farsi sentire.
#Il caso GLM 4.7 Flash (MoE 30B-A3B)
È qui che la 5070 Ti diventa particolarmente interessante nel 2026. GLM 4.7 Flash è un modello Mixture-of-Experts: 30 miliardi di parametri in totale, ma solo 3 miliardi attivati per token (architettura 30B-A3B, licenza MIT, molto buono per gli agenti). La VRAM totale richiesta rimane quella del modello completo, ma la velocità di inferenza è vicina a quella di un 3B denso.
- GLM 4.7 Flash Q4_K_M
- Circa 78 tok/s in generazione. VRAM utilizzata: 18,4 GB — sì, supera la capacità disponibile. Ollama trasferisce automaticamente 2 GB nella RAM di sistema, portando la velocità effettivamente osservata a 64 tok/s nella pratica.
- GLM 4.7 Flash Q3_K_M
- Circa 71 tok/s. VRAM utilizzata: 14,8 GB. Tutto in VRAM, contesto 16k possibile. La perdita di qualità rispetto al Q4 è bassa (≈1-2 % sui benchmark pubblici).
- gpt-oss 20B (MXFP4)
- Circa 96 tok/s. VRAM utilizzata: 14 GB. Il modello open-weight di OpenAI, molto veloce grazie alla quantizzazione MXFP4 nativa e con 131k di contesto — rientra appena nei 16 GB con un contesto moderato.
Verdetto MoE: Q3_K_M è il giusto compromesso su questa scheda per GLM 4.7 Flash. Si mantiene la qualità di un 30B con la velocità di un 3B e tutto rimane in VRAM.
#Spingersi fino a 27-30B: Qwen 3.8 e Granite 4.2
I grandi modelli densi e professionali da circa 27-30B rappresentano la fascia ragionevolmente gestibile dalla scheda. Oltre, si entra nel campo dell'offload massiccio.
- Qwen 3.8 27B Q4_K_M
- Circa 24 tok/s in generazione con offload da 2 a 3 GB nella RAM. VRAM utilizzata: tutti i 16 GB più un po' di RAM. Uscito il 14/08/2026, con un contesto di 262k e capacità visive: è il modello «vicino a Copilot» di questa fascia. Tende a ragionare eccessivamente con l'impostazione di ragionamento predefinita: impostala su low per risposte più dirette.
- Qwen 3.8 27B Q3_K_M
- Circa 36 tok/s. VRAM utilizzata: 14 GB, tutto in VRAM. Un buon compromesso se vuoi usare in modo fluido questo grande modello denso.
- Granite 4.2 30B Q4_K_M
- Intorno a 22 tok/s con offload. VRAM utilizzata: 18 GB. Orientato all'uso professionale/aziendale, profilo quasi identico a Qwen 3.8 27B.
- Nemotron 3.5 Lightning 30B Q4_K_M
- Non entra nella VRAM: 25 GB in Q4, richiede un offload massiccio su RAM/SSD, velocità intorno a 3 tok/s — non è un'opzione utilizzabile quotidianamente con 16 GB (neanche con 24 GB).
#Prezzo rispetto alle 5080 e 5090
Il semplice calcolo prezzo / token al secondo. Non è perfetto (si ignorano l'ammortamento e l'elettricità), ma mette gli ordini di grandezza in prospettiva.
- RTX 5070 Ti (≈ 1 400 € a fine settembre 2026)
- Su Gemma 4 12B: ≈ 22,5 €/(tok/s). Su GLM 4.7 Flash Q3: ≈ 19,8 €/(tok/s). Su Qwen 3.8 27B Q3: ≈ 38,9 €/(tok/s).
- RTX 5080 (≈ 1 850 € a fine settembre 2026)
- Su Gemma 4 12B: ≈ 25,8 €/(tok/s). Su GLM 4.7 Flash Q3: ≈ 22,6 €/(tok/s). Aumento effettivo della velocità (dal 15 al 20%), ma costo superiore.
- RTX 5090 (≈ 5 700 € a fine settembre 2026)
- Su Gemma 4 12B: ≈ 67,0 €/(tok/s). Su Qwen 3.8 27B Q4: ≈ 104,5 €/(tok/s). Diventa competitiva solo quando si mira a 70B+, cosa non fattibile su 16 GB.
- RTX 4070 Ti Super 16 GB (usato, prezzo variabile)
- Su Gemma 4 12B: 15,3 €/(tok/s). Più economica ma circa il 25% più lenta sui MoE a causa della memoria GDDR6X più lenta. Rimane una scelta valida sul mercato dell'usato.
- RTX 3090 usata (usata, prezzo variabile)
- Con Gemma 4 12B, 24 GB di VRAM a un prezzo variabile sul mercato dell'usato. Rapporto prestazioni/euro interessante se accetti una GPU Ampere usata e un consumo di 350 W.
La 5070 Ti non è la più conveniente in termini di puro rapporto prezzo/prestazioni (€/perf) — la 3090 usata resta in vantaggio. Diventa la scelta giusta quando si vuole una scheda nuova, in garanzia, con consumi contenuti e supporto FP4 per il futuro.
#Consumo e comportamento termico
Misurazioni al momento della installazione, macchina completa, alimentazione 850 W Gold, GPU solo in pilota, schermo spento.
- In attesa (modello caricato, nessuna generazione)
- La macchina consuma 75 W in totale, di cui circa 15 W per la GPU. Consumi molto contenuti: l'inferenza in attesa non pesa sulla tua bolletta.
- Inferenza 8B Q4
- Picco di 195 W alla presa (GPU ~145 W). La scheda non viene sfruttata al massimo: la memoria GDDR7 si satura prima della capacità di calcolo, come sulla 5090.
- Inferenza 12B Q4
- Picco di 245 W alla presa (GPU ~190 W). Equilibrio ottimale tra consumo e utilità.
- Inferenza MoE 30B-A3B
- Picco di 280 W alla presa (GPU ~225 W). Il MoE scalda meno di un modello denso equivalente.
- Elaborazione del prompt: batch da 4096 token
- Picco di 360 W misurati alla presa (GPU ~298 W). È il momento in cui il carico di calcolo a saturazione spinge la scheda vicino al suo TGP nominale di 300 W.
- Temperatura GPU massima
- 72 °C sotto carico prolungato, ventole intorno a 1.600 giri/min. Modello custom con tre ventole — più silenzioso rispetto alla 5090.
#Verdetto: sweet spot o no?
- Per chi è l'acquisto giusto
- Vuoi una scheda nuova e prevedi di eseguire principalmente modelli 8B-12B, con qualche incursione nei 30B MoE e nei 27-30B densi in Q3. Apprezzi una scheda silenziosa e dai consumi ragionevoli. È il profilo per cui è pensata la 5070 Ti.
- Quando scegliere invece la 5080
- Se esegui quotidianamente modelli densi da 27-30B in Q4 e trovi limitanti i 16 GB occupati fino all'ultimo. La 5080 ha la stessa VRAM ma una banda passante superiore del 7 % — un guadagno modesto per ≈ 450 € in più.
- Quando puntare sulla 5090
- Se vuoi un modello 70B+ in Q4 in locale o un fine-tuning LoRA su modelli 13B+. 16 GB non sono sufficienti né per l'uno né per l'altro.
- Quando preferire una 3090 di seconda mano
- Budget limitato, disponibilità ad acquistare hardware usato, necessità di 24 GB per modelli da 27-30B in Q5 o per iniziare a usare modelli da 70B con offload leggero. Perdi il supporto FP4, ma il risparmio resta considerevole (da valutare in base al prezzo dell'usato al momento).
- Quando preferire una 4070 Ti Super
- Se ne trovi una usata a un prezzo interessante (variabile a seconda del mercato) e per il tuo caso d'uso basta un modello 12B. In pratica è molto simile, ma costa molto meno.
#Per approfondire
Tre letture utili per andare oltre:
- Scegliere bene la quantizzazione
- Il tutorial "Scegliere la quantizzazione (Q4, Q5, Q8, FP16)" spiega perché il Q3_K_M diventa utile su 16 GB quando si mira a modelli da 30B e oltre.
- Amplia il confronto
- La guida "Scegliere una GPU per l'IA locale" amplia la panoramica oltre la gamma Blackwell ed è utile se sei ancora indeciso.
- Approfondire un modello MoE
- Il tutorial "Llama 4 Scout in locale" approfondisce il funzionamento di MoE, particolarmente adatto per una scheda da 16 GB come la 5070 Ti.
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.