Intermedio 11 minRTX 50

Quale LLM su RTX 5070 Ti (16 GB) ?

La RTX 5070 Ti (febbraio 2025) è probabilmente la migliore scheda del 2025 per l'IA locale destinata al grande pubblico. 16 GB di VRAM GDDR7, 896 GB/s di larghezza di banda, 8.960 core CUDA: esegue Granite 4.2 8B a circa 50 token al secondo e Mistral Small 24B Q4 senza difficoltà, per circa 1.400 € a fine settembre 2026 — ossia circa 450 € in meno rispetto a una 5080. Questa guida spiega in dettaglio perché rappresenta il punto di equilibrio ideale del 2026 e quali modelli installare.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: RTX 5070 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#La RTX 5070 Ti, il punto di equilibrio con 16 GB

Architettura
Blackwell GB203 (stesso die della 5080, più CU disattivate).
VRAM
16 GB GDDR7 a 28 Gbps, bus da 256 bit. Banda passante di 896 GB/s.
Core CUDA
8 960. Tensor Cores di 5ª generazione, supporto nativo FP4.
TDP
300 W. Alimentatore da 750 W raccomandato.
Prezzo MSRP
884 € al lancio. ≈ 1 400 € a fine settembre 2026 (versioni custom).
→
Perché è il punto ottimale
Gli stessi 16 GB di GDDR7 di una 5080, con una banda passante pari al 93% di quella di quest'ultima, ma a circa 450 € in meno. Per l'IA locale, dove la VRAM e la banda passante della memoria sono determinanti, la differenza nel numero di CU comporta una perdita di velocità di appena l'8-12%, a fronte di una differenza di prezzo del 30%.

#1. Modelli LLM compatibili

Modelli raccomandati — RTX 5070 Ti 16 GB
ModelloQuantVRAM del modelloTokens/secUso
Granite 4.2 8BQ4_K_M4,6 GB45-55Chat istantanea
Gemma 4 12BQ4_K_M7 GB25-31Chat/RAG quotidiano
Qwen 3.5 9BQ4_K_M6 GB25-31Assistente per il codice in VS Code
gpt-oss 20BQ4_K_M13 GB50-61Chat + RAG + FR
Qwen 3.5 9BQ8_011 GB18-22Qualità massima / ragionamento
Devstral Small 2 24BQ4_K_M14 GB14-17Chat di qualità
Mistral Small 24BQ4_K_M14 GB28-35Versatile premium
Qwen 3.6 35B-A3BQ3_K_M~15 GB22-28RAG avanzato, MoE veloce (offload leggero)

#2. Installazione (Ollama + CUDA)

  1. 01
    Driver NVIDIA 570+
    Necessari per Blackwell. GeForce Experience su Windows, apt install nvidia-driver-570 su Ubuntu.
  2. 02
    Ollama
    Programma di installazione standard da ollama.com, con CUDA integrato. ollama run granite4.2:8b per un test immediato.
  3. 03
    Verifica
    nvidia-smi deve mostrare RTX 5070 Ti, 16376 MiB. ollama ps durante una conversazione: PROCESSOR 100% GPU.
Setup Linux completo
sudo apt update
sudo apt install nvidia-driver-570
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral-small

#3. Velocità per quantizzazione (ordini di grandezza)

RTX 5070 Ti — token/sec (valori indicativi), Ollama recente, batch 1, Ryzen 9 7900X
ModelloQ4_K_MQ5_K_MQ6_KQ8_0
Granite 4.2 8B50 t/s46 t/s42 t/s34 t/s
Qwen 3.5 9B30 t/s28 t/s26 t/s22 t/s
Gemma 4 12B28 t/s26 t/s24 t/s20 t/s
Mistral Small 24B32 t/s28 t/s——
Devstral 24B16 t/s14 t/s——

#4. Ottimizzazioni Blackwell

Flash Attention 3
Attivo per impostazione predefinita, +10-14 % sui contesti 4k+. Visibile nei log di llama.cpp.
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permette 32k di contesto su Granite 4.2 8B in circa 5-6 GB invece di 8.
NVFP4 pronto per il futuro
Hardware presente ma poco sfruttato nel 2026. Tra 12-18 mesi, Ollama supporterà FP4 → aumento di velocità atteso del 40%.
Undervolt
250 W invece di 300 W (tramite MSI Afterburner -80 mV): -1 % di prestazioni LLM, -5 °C, case più silenzioso.

#5. 5070 Ti vs 4070 Ti Super vs 5080

Le tre schede premium da 16 GB
Criterio5070 Ti4070 Ti Super5080
VRAM16 GB GDDR716 GB GDDR6X16 GB GDDR7
Larghezza di banda896 GB/s672 GB/s960 GB/s
Granite 4.2 8B Q450 t/s42 t/s56 t/s
Gemma 4 12B Q428 t/s23 t/s32 t/s
Prezzo 2026≈ 1 400 € alla fine di settembre 2026usata, prezzo variabile≈ 1 850 € a fine settembre 2026
Perf/€ LLM★★★★★★★★★★★★

#Verdetto sull'acquisto nel 2026

La migliore scelta per gli LLM nel 2026 per il grande pubblico
Per chi, a fine settembre 2026, ha circa 1.400 € di budget per la GPU e vuole usare seriamente gli LLM senza passare a una 5090. Il suo rapporto prestazioni/€ supera nettamente quello della 5080.
Passare da una 4070 Ti Super?
+20 % di velocità con gli LLM, +33 % di larghezza di banda. Non indispensabile se tutto funziona, ma può essere giustificato se vendi la 4070 Ti Super a un prezzo dell'usato variabile.
vs RTX 4090 usata
La 4090 usata (prezzo dell'usato variabile) mantiene il vantaggio per i modelli 70B (24 GB di VRAM). Se non ne hai bisogno, la 5070 Ti offre prestazioni quasi equivalenti con gli LLM 14B a un prezzo nettamente inferiore.

#Domande frequenti

RTX 5070 Ti o RTX 5080 per LLM?+
5070 Ti senza esitazioni se il tuo budget è < 1 700 €. Perdi circa il 10 % di velocità su Granite 4.2 8B (50 vs 56 tok/s) in cambio di circa 450 € risparmiati. Stessa VRAM (16 GB), stessa generazione, stessa GDDR7. La 5080 si giustifica per un uso misto gaming 4K + LLM in cui vuoi il top.
La RTX 5070 Ti 16 GB può eseguire Mistral Small 24B?+
Sì, in Q4_K_M (14 GB) a 28-35 token/secondo. È il modello polivalente che sfrutta meglio i suoi 16 GB. In Q5_K_M (17 GB), richiede un leggero offload ma resta utilizzabile a 20-25 tok/s.
Qual è la differenza tra RTX 4070 Ti Super e RTX 5070 Ti?+
Stessa VRAM (16 GB) ma GDDR7 invece di GDDR6X → +33% di banda. Risultato LLM: +20-25% di token al secondo. Prezzo simile all'uscita, ma la 4070 Ti Super si trova meno cara di seconda mano (~750 € vs 950 € nuova).
È possibile fare QLoRA su RTX 5070 Ti 16 GB?+
Sì, senza difficoltà su modelli da 7B-8B (10-12 GB richiesti con batch 4, contesto 2048). Per il QLoRA su un modello da 14B, il margine è ridotto ma è fattibile con unsloth. Per il QLoRA su un modello da 24B: impossibile, servono almeno 20 GB.
Un alimentatore da 650 W basta per una RTX 5070 Ti?+
Sì, con una CPU ≤ 150 W (Ryzen 7600/7700, Core i5). TDP: 300 W GPU + 150 W CPU + 50 W sistema = 500 W nominali; 650 W offrono margine. Se la CPU è ≥ 180 W (9950X, 14900K), punta a 750 W.
La RTX 5070 Ti supporta FP4 / NVFP4?+
Sì, i Tensor Cores 5ª generazione Blackwell gestiscono nativamente FP4. Nel 2026, Ollama e llama.cpp non li sfruttano ancora — arriverà. Attraverso TensorRT-LLM 0.18+ o vLLM 0.7+, si osserva già un +30-40 % rispetto a Q4_K_M sui modelli quantizzati in NVFP4.
Ho una RTX 3080 da 10 GB: vale la pena passare alla nuova scheda?+
Sì, salto generazionale enorme. +60 % di VRAM (10 → 16 GB — apre i 14B-24B), +3× la banda passante (760 → 896 GB/s dopo l'inflazione GDDR7), +2× la velocità di base. Se usi un LLM ogni giorno, questo è l'upgrade più conveniente del 2026.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.