Principiante 11 minGPU

RTX 5070 Ti (16 GB) per LLM locale: modelli e tokens/s

Ci chiediamo tutti quale sia il giusto equilibrio tra VRAM, velocità e costo. La RTX 5070 Ti si colloca proprio al centro della gamma Blackwell: 16 GB di GDDR7, circa 1.400 € a fine settembre 2026, un TGP ragionevole. La vera domanda sulla RTX 5070 Ti per gli LLM in locale è: questa scheda riesce a gestire i modelli che contano nel 2026 — GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B — senza farci rimpiangere di non aver scelto la 5080 o la 5090?

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: RTX 5070 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#Perché la 5070 Ti?

Il mercato delle GPU nel 2026 è segmentato in modo molto chiaro: la 5060 Ti 16 GB è lenta con i prompt lunghi, la 5080 costa ≈ 450 € in più a parità di VRAM e la 5090 resta un investimento professionale da ≈ 5.700 € a fine settembre 2026. Tra le due, la 5070 Ti occupa il posto che occupava la 4070 Ti Super un anno fa: 16 GB di VRAM, una buona larghezza di banda della memoria e un prezzo ancora accettabile come budget per un hobby preso sul serio.

Per un LLM locale, ciò che conta prima di tutto è la VRAM (quanto può essere grande il modello che entra in memoria) e la banda passante della memoria (a quale velocità si leggono i pesi per generare ogni token). La 5070 Ti soddisfa entrambi i requisiti senza compromessi significativi.

i
Cosa viene testato in questa guida
Qwen 3.5 9B Q4_K_M, Granite 4.2 8B Q4_K_M, Gemma 4 12B Q4_K_M, GLM 4.7 Flash (MoE 30B-A3B) in Q4_K_M e Q3_K_M, gpt-oss 20B (MXFP4) e Qwen 3.8 27B Q4_K_M. Tutti attraverso Ollama 0.7, driver NVIDIA 580.x, Windows 11 e Ubuntu 24.04.

#Cosa offre davvero la scheda

VRAM
16 GB GDDR7 — la stessa quantità della 5080, la metà rispetto alla 5090, ma soprattutto: GDDR7 e non GDDR6X. L'aumento della banda passante rispetto alla generazione precedente è evidente.
Banda passante della memoria
Intorno a 896 GB/s. A titolo di confronto: 504 GB/s sulla 4070 Ti Super, 960 GB/s sulla 5080, 1792 GB/s sulla 5090. La 5070 Ti è più vicina alla 5080 che alla 4070 Ti Super.
Compute
Architettura Blackwell, Tensor Cores 5a generazione con supporto FP4. La maggior parte dei motori di inferenza (llama.cpp, vLLM) non li sfrutta ancora nel 2026, ma questo è in corso.
TGP
300 W di potenza nominale TGP. Connettore 12V-2x6 (alimentatore ATX 3.0/3.1 fortemente consigliato).
PCIe
PCIe 5.0 x16. Non critico per l'inferenza locale (il modello rimane in VRAM), utile per i caricamenti e il multi-GPU.
Prezzo osservato
Tra 880 e 1.050 € per i modelli custom a giugno 2026. Non esiste una FE per questo modello.

#Requisiti della macchina

Niente di strano, ma alcuni punti da verificare prima di investire.

Alimentazione
750 W minimo, 850 W raccomandato se si ha un CPU potente. ATX 3.0/3.1 con connettore nativo 12V-2x6 ideale — un adattatore da 4x8 morsetti funziona ma rimane una fonte di problemi.
CPU
Qualsiasi Ryzen 7000/9000 o Intel di 13ª/14ª generazione è più che sufficiente. La CPU non svolge alcun lavoro durante l'inferenza sulla GPU: abbiamo eseguito i benchmark su un 7700X senza colli di bottiglia.
RAM di sistema
32 GB di RAM DDR5 offrono un buon margine. Se prevedi di usare l'offload nella RAM di sistema per modelli > 16 GB (DeepSeek V3.2, Kimi K2), passa a 64 o 128 GB.
OS
Windows 11 24H2 e Ubuntu 24.04 LTS supportano il driver 580.x senza problemi. Driver NVIDIA Studio (Windows) o il driver di produzione (Linux) — non serve il Game Ready per Ollama.
!
Connettore 12V-2x6
Come sulla 5090 e sulla 4090, il connettore di alimentazione deve essere inserito fino in fondo, fino al clic. Sono stati segnalati diversi casi di connettori fusi all'inizio del 2026 su cavi di terze parti non certificati. Usa quello fornito con l'alimentatore o un cavo PCIe 5.1 certificato.

#Installazione Ollama + driver

  1. 01
    Installare il driver NVIDIA 580.x o successivo
    Su Windows: NVIDIA App, scegliere il driver Studio. Su Linux: sudo ubuntu-drivers install --gpgpu per Ubuntu, oppure il runfile ufficiale. Verifica con nvidia-smi che la scheda e la VRAM siano effettivamente visibili.
  2. 02
    Installare Ollama
    Scarica da ollama.com (programma di installazione per Windows o comando Linux). Il daemon ascolta per impostazione predefinita su http://localhost:11434 e rileva automaticamente la 5070 Ti tramite CUDA.
  3. 03
    Verificare che la GPU venga effettivamente utilizzata
    Eseguire ollama run qwen3.5:9b, poi monitorare nvidia-smi dmon -s u in un terminale separato. La colonna sm (utilizzo delle risorse di calcolo) deve salire al 60-95% durante la generazione.
  4. 04
    Regolare il contesto
    Per impostazione predefinita, Ollama carica un contesto di 4096 token. Con 16 GB, si può arrivare a 16k o 32k sui modelli 8B senza problemi. Variabile OLLAMA_CONTEXT_LENGTH o parametro num_ctx nell'API.
Verificare il rilevamento della GPU
ollama ps
# Doit afficher la colonne PROCESSOR à 100% GPU

nvidia-smi --query-gpu=name,memory.total,memory.used,utilization.gpu --format=csv
# Doit montrer une RTX 5070 Ti avec ~16 Go total

#Token/sec su 8B e 14B

I modelli che entrano comodamente in memoria anche con un contesto ampio. Misurazioni effettuate con un prompt di 512 token e 256 token generati, media su 5 esecuzioni.

Qwen 3.5 9B Q4_K_M
Circa 90 tok/s in generazione, elaborazione del prompt a 2.800 tok/s. VRAM utilizzata: 6,6 GB. Restano 9 GB per il contesto — un margine confortevole a 32k, e il modello arriva a una finestra di contesto fino a 256k (visione inclusa).
Granite 4.2 8B Q4_K_M
Circa 94 tok/s. VRAM utilizzata: 5,3 GB, molto efficiente nell'uso dei token e con un contesto di 128k. L'alternativa parca nei consumi a Qwen quando si vuole il massimo throughput.
Gemma 4 12B Q4_K_M
Circa 62 tok/s. VRAM utilizzata: 7,6 GB. È il punto di equilibrio ideale nella fascia media, con un ampio margine sulla scheda: restano 8 GB per il contesto e la cache KV, e Gemma 4 è multimodale (Apache 2.0 da aprile 2026).
Qwen 3.5 9B Q8_0
Circa 48 tok/s. VRAM utilizzata: 11 GB. La qualità massima della fascia: lo stesso 9B ma in Q8, quando vuoi i risultati migliori senza cambiare modello.
Mistral Small 24B Q4_K_M
Circa 36 tok/s. VRAM utilizzata: 14,2 GB. Ci sta: è un modello generalista valido e buono in francese, ma il contesto è limitato a 8k senza offload — il limite dei 16 GB comincia a farsi sentire.
→
Interpretazione del dato
Oltre i 30 tok/s, il testo viene generato più velocemente di quanto una persona riesca a leggerlo comodamente. Sotto i 15 tok/s, l'attesa è evidente. La 5070 Ti mantiene tutti i modelli della gamma 8B-12B a una velocità confortevole e porta il 24B a una velocità utilizzabile.

#Il caso GLM 4.7 Flash (MoE 30B-A3B)

È qui che la 5070 Ti diventa particolarmente interessante nel 2026. GLM 4.7 Flash è un modello Mixture-of-Experts: 30 miliardi di parametri in totale, ma solo 3 miliardi attivati per token (architettura 30B-A3B, licenza MIT, molto buono per gli agenti). La VRAM totale richiesta rimane quella del modello completo, ma la velocità di inferenza è vicina a quella di un 3B denso.

GLM 4.7 Flash Q4_K_M
Circa 78 tok/s in generazione. VRAM utilizzata: 18,4 GB — sì, supera la capacità disponibile. Ollama trasferisce automaticamente 2 GB nella RAM di sistema, portando la velocità effettivamente osservata a 64 tok/s nella pratica.
GLM 4.7 Flash Q3_K_M
Circa 71 tok/s. VRAM utilizzata: 14,8 GB. Tutto in VRAM, contesto 16k possibile. La perdita di qualità rispetto al Q4 è bassa (≈1-2 % sui benchmark pubblici).
gpt-oss 20B (MXFP4)
Circa 96 tok/s. VRAM utilizzata: 14 GB. Il modello open-weight di OpenAI, molto veloce grazie alla quantizzazione MXFP4 nativa e con 131k di contesto — rientra appena nei 16 GB con un contesto moderato.

Verdetto MoE: Q3_K_M è il giusto compromesso su questa scheda per GLM 4.7 Flash. Si mantiene la qualità di un 30B con la velocità di un 3B e tutto rimane in VRAM.

#Spingersi fino a 27-30B: Qwen 3.8 e Granite 4.2

I grandi modelli densi e professionali da circa 27-30B rappresentano la fascia ragionevolmente gestibile dalla scheda. Oltre, si entra nel campo dell'offload massiccio.

Qwen 3.8 27B Q4_K_M
Circa 24 tok/s in generazione con offload da 2 a 3 GB nella RAM. VRAM utilizzata: tutti i 16 GB più un po' di RAM. Uscito il 14/08/2026, con un contesto di 262k e capacità visive: è il modello «vicino a Copilot» di questa fascia. Tende a ragionare eccessivamente con l'impostazione di ragionamento predefinita: impostala su low per risposte più dirette.
Qwen 3.8 27B Q3_K_M
Circa 36 tok/s. VRAM utilizzata: 14 GB, tutto in VRAM. Un buon compromesso se vuoi usare in modo fluido questo grande modello denso.
Granite 4.2 30B Q4_K_M
Intorno a 22 tok/s con offload. VRAM utilizzata: 18 GB. Orientato all'uso professionale/aziendale, profilo quasi identico a Qwen 3.8 27B.
Nemotron 3.5 Lightning 30B Q4_K_M
Non entra nella VRAM: 25 GB in Q4, richiede un offload massiccio su RAM/SSD, velocità intorno a 3 tok/s — non è un'opzione utilizzabile quotidianamente con 16 GB (neanche con 24 GB).
i
Q3_K_M o Q4_K_M?
Sui modelli da 27–30 miliardi di parametri, la differenza di qualità tra Q4_K_M e Q3_K_M resta piccola (generalmente 2–3 % su MMLU). Su una scheda da 16 GB, Q3_K_M mantiene tutto in VRAM e quasi triplica la velocità. È il compromesso giusto per questa configurazione.

#Prezzo rispetto alle 5080 e 5090

Il semplice calcolo prezzo / token al secondo. Non è perfetto (si ignorano l'ammortamento e l'elettricità), ma mette gli ordini di grandezza in prospettiva.

RTX 5070 Ti (≈ 1 400 € a fine settembre 2026)
Su Gemma 4 12B: ≈ 22,5 €/(tok/s). Su GLM 4.7 Flash Q3: ≈ 19,8 €/(tok/s). Su Qwen 3.8 27B Q3: ≈ 38,9 €/(tok/s).
RTX 5080 (≈ 1 850 € a fine settembre 2026)
Su Gemma 4 12B: ≈ 25,8 €/(tok/s). Su GLM 4.7 Flash Q3: ≈ 22,6 €/(tok/s). Aumento effettivo della velocità (dal 15 al 20%), ma costo superiore.
RTX 5090 (≈ 5 700 € a fine settembre 2026)
Su Gemma 4 12B: ≈ 67,0 €/(tok/s). Su Qwen 3.8 27B Q4: ≈ 104,5 €/(tok/s). Diventa competitiva solo quando si mira a 70B+, cosa non fattibile su 16 GB.
RTX 4070 Ti Super 16 GB (usato, prezzo variabile)
Su Gemma 4 12B: 15,3 €/(tok/s). Più economica ma circa il 25% più lenta sui MoE a causa della memoria GDDR6X più lenta. Rimane una scelta valida sul mercato dell'usato.
RTX 3090 usata (usata, prezzo variabile)
Con Gemma 4 12B, 24 GB di VRAM a un prezzo variabile sul mercato dell'usato. Rapporto prestazioni/euro interessante se accetti una GPU Ampere usata e un consumo di 350 W.

La 5070 Ti non è la più conveniente in termini di puro rapporto prezzo/prestazioni (€/perf) — la 3090 usata resta in vantaggio. Diventa la scelta giusta quando si vuole una scheda nuova, in garanzia, con consumi contenuti e supporto FP4 per il futuro.

#Consumo e comportamento termico

Misurazioni al momento della installazione, macchina completa, alimentazione 850 W Gold, GPU solo in pilota, schermo spento.

In attesa (modello caricato, nessuna generazione)
La macchina consuma 75 W in totale, di cui circa 15 W per la GPU. Consumi molto contenuti: l'inferenza in attesa non pesa sulla tua bolletta.
Inferenza 8B Q4
Picco di 195 W alla presa (GPU ~145 W). La scheda non viene sfruttata al massimo: la memoria GDDR7 si satura prima della capacità di calcolo, come sulla 5090.
Inferenza 12B Q4
Picco di 245 W alla presa (GPU ~190 W). Equilibrio ottimale tra consumo e utilità.
Inferenza MoE 30B-A3B
Picco di 280 W alla presa (GPU ~225 W). Il MoE scalda meno di un modello denso equivalente.
Elaborazione del prompt: batch da 4096 token
Picco di 360 W misurati alla presa (GPU ~298 W). È il momento in cui il carico di calcolo a saturazione spinge la scheda vicino al suo TGP nominale di 300 W.
Temperatura GPU massima
72 °C sotto carico prolungato, ventole intorno a 1.600 giri/min. Modello custom con tre ventole — più silenzioso rispetto alla 5090.
→
Limitare il consumo
nvidia-smi -pl 230 limita la scheda a 230 W. Su Gemma 4 12B Q4, si perde circa il 4% di velocità (62 → 60 tok/s) per circa 60 W risparmiati. Interessante in uso 24/7 o se l'alimentazione è limitata.

#Verdetto: sweet spot o no?

Per chi è l'acquisto giusto
Vuoi una scheda nuova e prevedi di eseguire principalmente modelli 8B-12B, con qualche incursione nei 30B MoE e nei 27-30B densi in Q3. Apprezzi una scheda silenziosa e dai consumi ragionevoli. È il profilo per cui è pensata la 5070 Ti.
Quando scegliere invece la 5080
Se esegui quotidianamente modelli densi da 27-30B in Q4 e trovi limitanti i 16 GB occupati fino all'ultimo. La 5080 ha la stessa VRAM ma una banda passante superiore del 7 % — un guadagno modesto per ≈ 450 € in più.
Quando puntare sulla 5090
Se vuoi un modello 70B+ in Q4 in locale o un fine-tuning LoRA su modelli 13B+. 16 GB non sono sufficienti né per l'uno né per l'altro.
Quando preferire una 3090 di seconda mano
Budget limitato, disponibilità ad acquistare hardware usato, necessità di 24 GB per modelli da 27-30B in Q5 o per iniziare a usare modelli da 70B con offload leggero. Perdi il supporto FP4, ma il risparmio resta considerevole (da valutare in base al prezzo dell'usato al momento).
Quando preferire una 4070 Ti Super
Se ne trovi una usata a un prezzo interessante (variabile a seconda del mercato) e per il tuo caso d'uso basta un modello 12B. In pratica è molto simile, ma costa molto meno.
i
Il giudizio in una frase
Per eseguire LLM in locale nel 2026, sì, la RTX 5070 Ti è un punto ottimale — a patto di accettare che i 16 GB ti precludano i modelli da 70B e che il vero punto forte di questa scheda siano i modelli multimodali da 12B eseguiti senza difficoltà e i modelli 30B-MoE in Q3/Q4.

#Per approfondire

Tre letture utili per andare oltre:

Scegliere bene la quantizzazione
Il tutorial "Scegliere la quantizzazione (Q4, Q5, Q8, FP16)" spiega perché il Q3_K_M diventa utile su 16 GB quando si mira a modelli da 30B e oltre.
Amplia il confronto
La guida "Scegliere una GPU per l'IA locale" amplia la panoramica oltre la gamma Blackwell ed è utile se sei ancora indeciso.
Approfondire un modello MoE
Il tutorial "Llama 4 Scout in locale" approfondisce il funzionamento di MoE, particolarmente adatto per una scheda da 16 GB come la 5070 Ti.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.