Quale LLM su RTX 5070 (12 GB) ?
La RTX 5070 dispone di 12 GB di GDDR7 a 672 GB/s: carica in VRAM tutti i modelli fino a circa 10 GB, tra cui Qwen 3.5 9B (6,6 GB) e Gemma 4 12B (da 7,7 a 8 GB), lasciando un buon margine per il contesto. Non carica Mistral Small 24B né gpt-oss 20B, che pesano 14 GB. Il suo limite teorico raggiunge circa 127 token/s su un modello da 5,3 GB, e 12 GB rimangono la soglia da considerare prima dell'acquisto.
La RTX 5070 è la scheda da 12 GB più veloce della generazione Blackwell, con una banda passante di 672 GB/s. Il suo limite non è la velocità ma la capacità: 12 GB bastano per i modelli da 4B a 12B, ma non oltre. Questa guida quantifica quali modelli rientrano nella memoria disponibile e quali la superano, spiega come configurare Ollama per il contesto e quando la 5070 Ti da 16 GB diventa l'acquisto giusto.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: RTX 5070 12 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RTX 5070 per un LLM locale: ciò che permettono 12 GB di GDDR7
Una RTX 5070 carica senza problemi modelli da 4B a 12B in Q4. Qwen 3.5 9B pesa 6,6 GB e Gemma 4 12B da 7,7 a 8 GB secondo la libreria Ollama: entrambi rientrano nei 12 GB con un margine da 4 a 5 GB per il contesto, consentendo 16.000 token o più con la cache K/V quantizzata. La scheda non carica però nessun modello da 14 GB: Mistral Small 24B e gpt-oss 20B superano i 12 GB. La sua velocità è eccellente per un uso interattivo: 672 GB/s su un bus da 192 bit. La 5070 è quindi adatta agli usi comuni e incontra un limite netto quando si punta a modelli di qualità superiore.
- Architettura
- Blackwell, 6 144 core CUDA e Tensor Core di 5a generazione secondo NVIDIA.
- Memoria
- 12 GB di GDDR7 su un bus da 192 bit, 672 GB/s di banda secondo Wikipedia.
- Potenza
- 250 W di potenza grafica totale; NVIDIA indica 650 W di alimentazione minima per l'intero PC.
- Prezzo di lancio
- 549 dollari, uscita il 5 marzo 2025 secondo Wikipedia.
#Quali modelli entrano in 12 GB
| Modello | Dimensione | Margine su 12 GB | Verdetto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 6,7 GB | Molto ampio, contesto lungo |
| Qwen 3.5 9B | 6,6 GB | 5,4 GB | Comodo |
| Gemma 4 12B | Da 7,7 a 8,0 GB | Da 4 a 4,3 GB | Funziona agevolmente, con un contesto possibile di 16.000 token |
| Mistral Small 24B | 14 GB | Negativo | Non entra in VRAM |
| Qwen 3.5 27B | 17 GB | Negativo | Non entra in VRAM |
Il riferimento del sito è di circa 0,6 GB per miliardo di parametri in Q4, considerando solo i pesi. Con 12 GB, il limite pratico si colloca intorno ai 14-16 miliardi di parametri se il contesto rimane breve, e intorno ai 12 miliardi se vuoi lavorare su documenti lunghi. Per un modello da 8B a 9B, il margine è molto superiore a quello necessario per un contesto ordinario.
#Installare Ollama e verificare la scheda
- 01Driver NVIDIAOllama richiede un driver NVIDIA 550 o successivo. Per una RTX 50, installa il driver più recente offerto da NVIDIA e controlla con nvidia-smi.
- 02Installare OllamaScarica l'installatore per il tuo sistema: CUDA è incluso.
- 03Avviare un modelloProva ollama run gemma4:12b per testare il limite della scheda, o ollama run qwen3.5:9b per un modello più leggero.
- 04VerificareEsegui ollama ps: la colonna PROCESSOR deve mostrare 100% GPU.
#Quale velocità aspettarsi: un limite massimo, non una misurazione
Nessuna velocità di generazione è presentata qui come una misurazione effettuata da noi. Il limite massimo di generazione è la banda passante divisa per la dimensione dei pesi. Una misurazione pubblica di terzi (LLaMA 3 8B in Q4_K_M con llama.cpp, maggio 2024) rileva 106 token/s su una RTX 4080 il cui limite massimo è di 156 token/s, ossia circa il 68 %. Assumendo il 70 % come ordine di grandezza, si ottengono le seguenti stime per un contesto breve.
| Modello (Q4) | Dimensione del modello | Tetto | Stima al 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 token/s | circa 89 token/s |
| Qwen 3.5 9B | 6,6 GB | 102 token/s | circa 71 token/s |
| Gemma 4 12B | 7,7 GB | 87 token/s | circa 61 token/s |
Questi limiti sono ben superiori alla velocità di lettura umana: la 5070 non sarà mai lenta con questi modelli. È limitata dalla capacità, non dalla velocità. Le stime diminuiscono con il contesto e l'elaborazione del prompt pesa più sul calcolo che sulla memoria.
#Gestire il contesto su 12 GB
Il margine di 4 GB di Gemma 4 12B si esaurisce rapidamente con un contesto lungo. Ollama quantizza la cache K/V in q8_0 per usare circa metà della memoria richiesta da f16, il formato predefinito, con una perdita di precisione molto bassa secondo la sua documentazione; questo richiede Flash Attention. È l'impostazione che rende un modello da 12B utilizzabile con documenti lunghi.
Un'insidia se il servizio è usato da più persone: più richieste in parallelo aumentano proporzionalmente il contesto riservato, secondo la FAQ di Ollama. Un modello che rientra nella memoria disponibile per un utente può superarla con tre utenti.
#Cosa si fa concretamente con 12 GB
Dodici gigabyte cambiano la natura degli utilizzi rispetto a 8 GB. Un modello da 9B lascia abbastanza spazio per un contesto di 16.000 token e un piccolo modello di embedding: è una configurazione comoda per un RAG personale. Un modello da 12B fornisce risposte di migliore qualità nella scrittura e nella sintesi, a costo di un contesto più limitato. Per un assistente di programmazione bastano un modello da 8B a 12B ed estratti mirati, ma non un intero repository caricato tutto insieme.
| Uso | Realistico? | Configurazione consigliata |
|---|---|---|
| Chat quotidiano | Sì, molto comodo | Qwen 3.5 9B o Gemma 4 12B |
| Riepilogo di documenti lunghi | Sì, con un contesto di 16.000 token | Gemma 4 12B, cache K/V in q8_0 |
| RAG sui tuoi file | Sì | Qwen 3.5 9B e un modello di embedding leggero |
| Assistente di programmazione | Sì, con un modello da 8B a 12B | Estratti mirati, contesto di 8.192 token |
| Modelli di 14 GB e oltre | No | Prevedere 16 GB di VRAM |
La scelta tra 9B e 12B dipende dall'attività. Il 9B lascia più margine e si presta a contesti lunghi; il 12B è più capace, ma ogni gigabyte di contesto conta. Parti dal più piccolo che risponda alle tue esigenze e passa al 12B solo se la qualità lo richiede.
#Quando la 5070 non basta più
Tre segnali indicano che serve più memoria. Vuoi un modello da 14 a 24B, tra cui Mistral Small 24B o gpt-oss 20B. Hai bisogno di un contesto superiore a 16.000 token su un 12B. Carichi diversi modelli insieme: generazione, embeddings, reranker. In questi casi, la velocità della 5070 non è il problema, e i passi successivi sono la 5070 Ti, la 5080 o una scheda da 24 GB.
#Cosa non si riesce a caricare con 12 GB
| Modello | Dimensione | Conseguenza |
|---|---|---|
| Mistral Small 24B | 14 GB | Scarica 2 GB nella RAM di sistema |
| Qwen 3.5 27B | 17 GB | Supera nettamente la capacità disponibile |
| Qwen 3.5 35B | 24 GB | Fuori portata: almeno 24 GB di VRAM |
| Modelli da 70B in Q4 | circa 40 GB | Fuori dalla portata di una GPU consumer da 12 GB |
Un modello che supera la capacità della VRAM non va in crash: una parte dei pesi viene letta dalla RAM di sistema e la velocità di generazione cala nettamente, perché il collegamento PCIe è molto più lento della GDDR7. Un modello da 14 GB su 12 GB di VRAM è quindi utilizzabile per un test, ma non per l'uso quotidiano. Per questi modelli, punta a 16 GB o più.
#Giocare ed eseguire un LLM sulla stessa scheda
La RTX 5070 viene spesso utilizzata per entrambi gli usi. Il modello caricato occupa la VRAM finché rimane in memoria, e anche un gioco recente richiede diversi gigabyte: con 12 GB, i due insieme superano rapidamente la capacità disponibile. La regola è semplice: rimuovi il modello dalla memoria prima di avviare un gioco, poi ricaricalo. Ollama libera la memoria dopo un periodo di inattività, e ollama ps indica cosa è ancora caricato. Se vuoi un assistente disponibile durante le partite, preferisci un piccolo modello da 4B.
#Una 4070 Ti Super usata come alternativa?
La domanda si pone spesso: una RTX 4070 Ti Super usata, con 16 GB, oppure una RTX 5070 nuova, con 12 GB? Per gli LLM prevale la capacità: con 16 GB si possono caricare modelli da 14 GB che la 5070 non può ospitare. La 5070 mantiene il vantaggio della garanzia, di un consumo più basso (250 W) e della memoria GDDR7. Se i tuoi modelli rientrano nei 12 GB, la 5070 nuova è una scelta ragionevole; altrimenti, la capacità ha la priorità. La guida dedicata tratta in dettaglio la 4070 Ti Super.
#5070 o 5070 Ti: 12 GB o 16 GB
| Criterio | RTX 5070 | RTX 5070 Ti |
|---|---|---|
| Memoria | 12 GB GDDR7, 192 bit | 16 GB GDDR7, 256 bit |
| Larghezza di banda | 672 GB/s | 896 GB/s |
| Core CUDA | 6 144 | 8 960 |
| Potenza grafica | 250 W | 300 W |
| Alimentazione minima | 650 W | 750 W |
| Modelli da 14 GB | No | Sì, con 2 GB di margine |
La 5070 Ti offre due cose: 4 GB di memoria in più, che permettono di eseguire Mistral Small 24B e gpt-oss 20B, e una larghezza di banda superiore del 33%. I prezzi consigliati al lancio erano di 549 dollari per la 5070 e di 749 dollari per la 5070 Ti, con una differenza di 200 dollari. Se i tuoi modelli rientrano nei 12 GB, la 5070 basta; se punti a modelli da 14 GB, la spesa aggiuntiva è un buon investimento. Consulta il monitoraggio dei prezzi per confrontarli al momento dell'acquisto.
#Verdetto 2026
- Compra una 5070 se
- I tuoi modelli hanno dimensioni comprese tra 4B e 12B e vuoi la velocità della generazione Blackwell. È molto capace per questo utilizzo.
- Preferisci la 5070 Ti se
- Vuoi esplorare modelli da 14 a 24B: i 16 GB fanno la differenza.
- Attenzione all'uso simultaneo di un gioco e di un LLM
- Un gioco recente e un modello caricato condividono i 12 GB: chiudi uno prima di avviare l'altro.
In sintesi, la 5070 è una scheda veloce il cui unico difetto è fermarsi a 12 GB. Se questo limite non ti crea problemi oggi, non te ne creerà nemmeno nei prossimi mesi, purché tu rimanga su modelli da 4B a 12B; se invece ti crea problemi, è meglio pagare subito per una maggiore capacità.
- Fonte: caratteristiche ufficiali NVIDIA (RTX 5070 e 5070 Ti)
- Fonte: FAQ ufficiale di Ollama (Flash Attention, cache K/V, parallelismo)
- Fonte: dimensioni di Gemma 4 nella libreria Ollama
#Domande frequenti
La RTX 5070 12 GB può eseguire un modello 70B?+
Quanti token al secondo su una RTX 5070?+
12 GB sono sufficienti per un uso professionale nel 2026?+
La RTX 5070 supporta DLSS 4 e un LLM contemporaneamente?+
Quale alimentatore serve per una RTX 5070?+
Come verificare che il modello rientri nella VRAM disponibile?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.