Quale LLM su RTX 5070 Ti (16 GB) ?
La RTX 5070 Ti (febbraio 2025) è probabilmente la migliore scheda del 2025 per l'IA locale destinata al grande pubblico. 16 GB di VRAM GDDR7, 896 GB/s di larghezza di banda, 8.960 core CUDA: esegue Granite 4.2 8B a circa 50 token al secondo e Mistral Small 24B Q4 senza difficoltà, per circa 1.400 € a fine settembre 2026 — ossia circa 450 € in meno rispetto a una 5080. Questa guida spiega in dettaglio perché rappresenta il punto di equilibrio ideale del 2026 e quali modelli installare.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: RTX 5070 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La RTX 5070 Ti, il punto di equilibrio con 16 GB
- Architettura
- Blackwell GB203 (stesso die della 5080, più CU disattivate).
- VRAM
- 16 GB GDDR7 a 28 Gbps, bus da 256 bit. Banda passante di 896 GB/s.
- Core CUDA
- 8 960. Tensor Cores di 5ª generazione, supporto nativo FP4.
- TDP
- 300 W. Alimentatore da 750 W raccomandato.
- Prezzo MSRP
- 884 € al lancio. ≈ 1 400 € a fine settembre 2026 (versioni custom).
#1. Modelli LLM compatibili
| Modello | Quant | VRAM del modello | Tokens/sec | Uso |
|---|---|---|---|---|
| Granite 4.2 8B | Q4_K_M | 4,6 GB | 45-55 | Chat istantanea |
| Gemma 4 12B | Q4_K_M | 7 GB | 25-31 | Chat/RAG quotidiano |
| Qwen 3.5 9B | Q4_K_M | 6 GB | 25-31 | Assistente per il codice in VS Code |
| gpt-oss 20B | Q4_K_M | 13 GB | 50-61 | Chat + RAG + FR |
| Qwen 3.5 9B | Q8_0 | 11 GB | 18-22 | Qualità massima / ragionamento |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 14-17 | Chat di qualità |
| Mistral Small 24B | Q4_K_M | 14 GB | 28-35 | Versatile premium |
| Qwen 3.6 35B-A3B | Q3_K_M | ~15 GB | 22-28 | RAG avanzato, MoE veloce (offload leggero) |
#2. Installazione (Ollama + CUDA)
- 01Driver NVIDIA 570+Necessari per Blackwell. GeForce Experience su Windows, apt install nvidia-driver-570 su Ubuntu.
- 02OllamaProgramma di installazione standard da ollama.com, con CUDA integrato. ollama run granite4.2:8b per un test immediato.
- 03Verificanvidia-smi deve mostrare RTX 5070 Ti, 16376 MiB. ollama ps durante una conversazione: PROCESSOR 100% GPU.
#3. Velocità per quantizzazione (ordini di grandezza)
| Modello | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Granite 4.2 8B | 50 t/s | 46 t/s | 42 t/s | 34 t/s |
| Qwen 3.5 9B | 30 t/s | 28 t/s | 26 t/s | 22 t/s |
| Gemma 4 12B | 28 t/s | 26 t/s | 24 t/s | 20 t/s |
| Mistral Small 24B | 32 t/s | 28 t/s | — | — |
| Devstral 24B | 16 t/s | 14 t/s | — | — |
#4. Ottimizzazioni Blackwell
- Flash Attention 3
- Attivo per impostazione predefinita, +10-14 % sui contesti 4k+. Visibile nei log di llama.cpp.
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Permette 32k di contesto su Granite 4.2 8B in circa 5-6 GB invece di 8.
- NVFP4 pronto per il futuro
- Hardware presente ma poco sfruttato nel 2026. Tra 12-18 mesi, Ollama supporterà FP4 → aumento di velocità atteso del 40%.
- Undervolt
- 250 W invece di 300 W (tramite MSI Afterburner -80 mV): -1 % di prestazioni LLM, -5 °C, case più silenzioso.
#5. 5070 Ti vs 4070 Ti Super vs 5080
| Criterio | 5070 Ti | 4070 Ti Super | 5080 |
|---|---|---|---|
| VRAM | 16 GB GDDR7 | 16 GB GDDR6X | 16 GB GDDR7 |
| Larghezza di banda | 896 GB/s | 672 GB/s | 960 GB/s |
| Granite 4.2 8B Q4 | 50 t/s | 42 t/s | 56 t/s |
| Gemma 4 12B Q4 | 28 t/s | 23 t/s | 32 t/s |
| Prezzo 2026 | ≈ 1 400 € alla fine di settembre 2026 | usata, prezzo variabile | ≈ 1 850 € a fine settembre 2026 |
| Perf/€ LLM | ★★★★★ | ★★★★ | ★★★ |
#Verdetto sull'acquisto nel 2026
- La migliore scelta per gli LLM nel 2026 per il grande pubblico
- Per chi, a fine settembre 2026, ha circa 1.400 € di budget per la GPU e vuole usare seriamente gli LLM senza passare a una 5090. Il suo rapporto prestazioni/€ supera nettamente quello della 5080.
- Passare da una 4070 Ti Super?
- +20 % di velocità con gli LLM, +33 % di larghezza di banda. Non indispensabile se tutto funziona, ma può essere giustificato se vendi la 4070 Ti Super a un prezzo dell'usato variabile.
- vs RTX 4090 usata
- La 4090 usata (prezzo dell'usato variabile) mantiene il vantaggio per i modelli 70B (24 GB di VRAM). Se non ne hai bisogno, la 5070 Ti offre prestazioni quasi equivalenti con gli LLM 14B a un prezzo nettamente inferiore.
#Domande frequenti
RTX 5070 Ti o RTX 5080 per LLM?+
La RTX 5070 Ti 16 GB può eseguire Mistral Small 24B?+
Qual è la differenza tra RTX 4070 Ti Super e RTX 5070 Ti?+
È possibile fare QLoRA su RTX 5070 Ti 16 GB?+
Un alimentatore da 650 W basta per una RTX 5070 Ti?+
La RTX 5070 Ti supporta FP4 / NVFP4?+
Ho una RTX 3080 da 10 GB: vale la pena passare alla nuova scheda?+
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.