Intermedio 11 minRTX 50

Quale LLM su RTX 5070 (12 GB) ?

Risposta diretta

La RTX 5070 dispone di 12 GB di GDDR7 a 672 GB/s: carica in VRAM tutti i modelli fino a circa 10 GB, tra cui Qwen 3.5 9B (6,6 GB) e Gemma 4 12B (da 7,7 a 8 GB), lasciando un buon margine per il contesto. Non carica Mistral Small 24B né gpt-oss 20B, che pesano 14 GB. Il suo limite teorico raggiunge circa 127 token/s su un modello da 5,3 GB, e 12 GB rimangono la soglia da considerare prima dell'acquisto.

La RTX 5070 è la scheda da 12 GB più veloce della generazione Blackwell, con una banda passante di 672 GB/s. Il suo limite non è la velocità ma la capacità: 12 GB bastano per i modelli da 4B a 12B, ma non oltre. Questa guida quantifica quali modelli rientrano nella memoria disponibile e quali la superano, spiega come configurare Ollama per il contesto e quando la 5070 Ti da 16 GB diventa l'acquisto giusto.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: RTX 5070 12 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RTX 5070 per un LLM locale: ciò che permettono 12 GB di GDDR7

Una RTX 5070 carica senza problemi modelli da 4B a 12B in Q4. Qwen 3.5 9B pesa 6,6 GB e Gemma 4 12B da 7,7 a 8 GB secondo la libreria Ollama: entrambi rientrano nei 12 GB con un margine da 4 a 5 GB per il contesto, consentendo 16.000 token o più con la cache K/V quantizzata. La scheda non carica però nessun modello da 14 GB: Mistral Small 24B e gpt-oss 20B superano i 12 GB. La sua velocità è eccellente per un uso interattivo: 672 GB/s su un bus da 192 bit. La 5070 è quindi adatta agli usi comuni e incontra un limite netto quando si punta a modelli di qualità superiore.

Architettura
Blackwell, 6 144 core CUDA e Tensor Core di 5a generazione secondo NVIDIA.
Memoria
12 GB di GDDR7 su un bus da 192 bit, 672 GB/s di banda secondo Wikipedia.
Potenza
250 W di potenza grafica totale; NVIDIA indica 650 W di alimentazione minima per l'intero PC.
Prezzo di lancio
549 dollari, uscita il 5 marzo 2025 secondo Wikipedia.

#Quali modelli entrano in 12 GB

Modelli su RTX 5070 (dimensioni in Ollama, solo pesi)
ModelloDimensioneMargine su 12 GBVerdetto
Granite 4.2 8B5,3 GB6,7 GBMolto ampio, contesto lungo
Qwen 3.5 9B6,6 GB5,4 GBComodo
Gemma 4 12BDa 7,7 a 8,0 GBDa 4 a 4,3 GBFunziona agevolmente, con un contesto possibile di 16.000 token
Mistral Small 24B14 GBNegativoNon entra in VRAM
Qwen 3.5 27B17 GBNegativoNon entra in VRAM

Il riferimento del sito è di circa 0,6 GB per miliardo di parametri in Q4, considerando solo i pesi. Con 12 GB, il limite pratico si colloca intorno ai 14-16 miliardi di parametri se il contesto rimane breve, e intorno ai 12 miliardi se vuoi lavorare su documenti lunghi. Per un modello da 8B a 9B, il margine è molto superiore a quello necessario per un contesto ordinario.

#Installare Ollama e verificare la scheda

  1. 01
    Driver NVIDIA
    Ollama richiede un driver NVIDIA 550 o successivo. Per una RTX 50, installa il driver più recente offerto da NVIDIA e controlla con nvidia-smi.
  2. 02
    Installare Ollama
    Scarica l'installatore per il tuo sistema: CUDA è incluso.
  3. 03
    Avviare un modello
    Prova ollama run gemma4:12b per testare il limite della scheda, o ollama run qwen3.5:9b per un modello più leggero.
  4. 04
    Verificare
    Esegui ollama ps: la colonna PROCESSOR deve mostrare 100% GPU.

#Quale velocità aspettarsi: un limite massimo, non una misurazione

Nessuna velocità di generazione è presentata qui come una misurazione effettuata da noi. Il limite massimo di generazione è la banda passante divisa per la dimensione dei pesi. Una misurazione pubblica di terzi (LLaMA 3 8B in Q4_K_M con llama.cpp, maggio 2024) rileva 106 token/s su una RTX 4080 il cui limite massimo è di 156 token/s, ossia circa il 68 %. Assumendo il 70 % come ordine di grandezza, si ottengono le seguenti stime per un contesto breve.

Limite teorico su RTX 5070 (672 GB/s)
Modello (Q4)Dimensione del modelloTettoStima al 70 %
Granite 4.2 8B5,3 GB127 token/scirca 89 token/s
Qwen 3.5 9B6,6 GB102 token/scirca 71 token/s
Gemma 4 12B7,7 GB87 token/scirca 61 token/s

Questi limiti sono ben superiori alla velocità di lettura umana: la 5070 non sarà mai lenta con questi modelli. È limitata dalla capacità, non dalla velocità. Le stime diminuiscono con il contesto e l'elaborazione del prompt pesa più sul calcolo che sulla memoria.

#Gestire il contesto su 12 GB

Il margine di 4 GB di Gemma 4 12B si esaurisce rapidamente con un contesto lungo. Ollama quantizza la cache K/V in q8_0 per usare circa metà della memoria richiesta da f16, il formato predefinito, con una perdita di precisione molto bassa secondo la sua documentazione; questo richiede Flash Attention. È l'impostazione che rende un modello da 12B utilizzabile con documenti lunghi.

Impostazioni del server Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

Un'insidia se il servizio è usato da più persone: più richieste in parallelo aumentano proporzionalmente il contesto riservato, secondo la FAQ di Ollama. Un modello che rientra nella memoria disponibile per un utente può superarla con tre utenti.

#Cosa si fa concretamente con 12 GB

Dodici gigabyte cambiano la natura degli utilizzi rispetto a 8 GB. Un modello da 9B lascia abbastanza spazio per un contesto di 16.000 token e un piccolo modello di embedding: è una configurazione comoda per un RAG personale. Un modello da 12B fornisce risposte di migliore qualità nella scrittura e nella sintesi, a costo di un contesto più limitato. Per un assistente di programmazione bastano un modello da 8B a 12B ed estratti mirati, ma non un intero repository caricato tutto insieme.

Usi su RTX 5070 (12 GB)
UsoRealistico?Configurazione consigliata
Chat quotidianoSì, molto comodoQwen 3.5 9B o Gemma 4 12B
Riepilogo di documenti lunghiSì, con un contesto di 16.000 tokenGemma 4 12B, cache K/V in q8_0
RAG sui tuoi fileSìQwen 3.5 9B e un modello di embedding leggero
Assistente di programmazioneSì, con un modello da 8B a 12BEstratti mirati, contesto di 8.192 token
Modelli di 14 GB e oltreNoPrevedere 16 GB di VRAM

La scelta tra 9B e 12B dipende dall'attività. Il 9B lascia più margine e si presta a contesti lunghi; il 12B è più capace, ma ogni gigabyte di contesto conta. Parti dal più piccolo che risponda alle tue esigenze e passa al 12B solo se la qualità lo richiede.

#Quando la 5070 non basta più

Tre segnali indicano che serve più memoria. Vuoi un modello da 14 a 24B, tra cui Mistral Small 24B o gpt-oss 20B. Hai bisogno di un contesto superiore a 16.000 token su un 12B. Carichi diversi modelli insieme: generazione, embeddings, reranker. In questi casi, la velocità della 5070 non è il problema, e i passi successivi sono la 5070 Ti, la 5080 o una scheda da 24 GB.

#Cosa non si riesce a caricare con 12 GB

Modelli oltre il limite dei 12 GB (dimensioni Ollama)
ModelloDimensioneConseguenza
Mistral Small 24B14 GBScarica 2 GB nella RAM di sistema
Qwen 3.5 27B17 GBSupera nettamente la capacità disponibile
Qwen 3.5 35B24 GBFuori portata: almeno 24 GB di VRAM
Modelli da 70B in Q4circa 40 GBFuori dalla portata di una GPU consumer da 12 GB

Un modello che supera la capacità della VRAM non va in crash: una parte dei pesi viene letta dalla RAM di sistema e la velocità di generazione cala nettamente, perché il collegamento PCIe è molto più lento della GDDR7. Un modello da 14 GB su 12 GB di VRAM è quindi utilizzabile per un test, ma non per l'uso quotidiano. Per questi modelli, punta a 16 GB o più.

#Giocare ed eseguire un LLM sulla stessa scheda

La RTX 5070 viene spesso utilizzata per entrambi gli usi. Il modello caricato occupa la VRAM finché rimane in memoria, e anche un gioco recente richiede diversi gigabyte: con 12 GB, i due insieme superano rapidamente la capacità disponibile. La regola è semplice: rimuovi il modello dalla memoria prima di avviare un gioco, poi ricaricalo. Ollama libera la memoria dopo un periodo di inattività, e ollama ps indica cosa è ancora caricato. Se vuoi un assistente disponibile durante le partite, preferisci un piccolo modello da 4B.

#Una 4070 Ti Super usata come alternativa?

La domanda si pone spesso: una RTX 4070 Ti Super usata, con 16 GB, oppure una RTX 5070 nuova, con 12 GB? Per gli LLM prevale la capacità: con 16 GB si possono caricare modelli da 14 GB che la 5070 non può ospitare. La 5070 mantiene il vantaggio della garanzia, di un consumo più basso (250 W) e della memoria GDDR7. Se i tuoi modelli rientrano nei 12 GB, la 5070 nuova è una scelta ragionevole; altrimenti, la capacità ha la priorità. La guida dedicata tratta in dettaglio la 4070 Ti Super.

#5070 o 5070 Ti: 12 GB o 16 GB

RTX 5070 e RTX 5070 Ti: cosa cambia per il LLM
CriterioRTX 5070RTX 5070 Ti
Memoria12 GB GDDR7, 192 bit16 GB GDDR7, 256 bit
Larghezza di banda672 GB/s896 GB/s
Core CUDA6 1448 960
Potenza grafica250 W300 W
Alimentazione minima650 W750 W
Modelli da 14 GBNoSì, con 2 GB di margine

La 5070 Ti offre due cose: 4 GB di memoria in più, che permettono di eseguire Mistral Small 24B e gpt-oss 20B, e una larghezza di banda superiore del 33%. I prezzi consigliati al lancio erano di 549 dollari per la 5070 e di 749 dollari per la 5070 Ti, con una differenza di 200 dollari. Se i tuoi modelli rientrano nei 12 GB, la 5070 basta; se punti a modelli da 14 GB, la spesa aggiuntiva è un buon investimento. Consulta il monitoraggio dei prezzi per confrontarli al momento dell'acquisto.

#Verdetto 2026

Compra una 5070 se
I tuoi modelli hanno dimensioni comprese tra 4B e 12B e vuoi la velocità della generazione Blackwell. È molto capace per questo utilizzo.
Preferisci la 5070 Ti se
Vuoi esplorare modelli da 14 a 24B: i 16 GB fanno la differenza.
Attenzione all'uso simultaneo di un gioco e di un LLM
Un gioco recente e un modello caricato condividono i 12 GB: chiudi uno prima di avviare l'altro.

In sintesi, la 5070 è una scheda veloce il cui unico difetto è fermarsi a 12 GB. Se questo limite non ti crea problemi oggi, non te ne creerà nemmeno nei prossimi mesi, purché tu rimanga su modelli da 4B a 12B; se invece ti crea problemi, è meglio pagare subito per una maggiore capacità.

#Domande frequenti

FAQ
La RTX 5070 12 GB può eseguire un modello 70B?+
No. Un 70B in Q4 occupa circa 40 GB per i soli pesi, cioè più di tre volte i 12 GB della scheda. Anche trasferendo parte del modello nella RAM di sistema, la generazione sarebbe estremamente lenta. Con 12 GB, resta su modelli da 4B a 12B; per un 70B, prevedi almeno 48 GB di memoria.
Quanti token al secondo su una RTX 5070?+
Nessuna misura affidabile è pubblicata qui. Il limite teorico, banda passante di 672 GB/s divisa per la dimensione del modello, è di circa 127 token/s per Granite 4.2 8B (5,3 GB), cioè circa 89 token/s al 70% di questo limite. È una stima che diminuisce quando il contesto si allunga.
12 GB sono sufficienti per un uso professionale nel 2026?+
Per una chat, la sintesi, un RAG o l'estrazione con un modello da 4B a 12B, sì. Per la scrittura di alta qualità o un assistente di codice su un repository di grandi dimensioni, i modelli da 14 a 24B che pesano 14 GB o più superano la capacità della scheda: prevedi 16 GB.
La RTX 5070 supporta DLSS 4 e un LLM contemporaneamente?+
Entrambi funzionano sulla scheda, ma condividono i 12 GB di VRAM. Un gioco recente occupa una parte significativa della memoria: carica il modello prima di avviare il gioco, oppure chiudilo mentre giochi. Il LLM e il gioco non devono essere eseguiti contemporaneamente con 12 GB di VRAM.
Quale alimentatore serve per una RTX 5070?+
NVIDIA indica una potenza grafica totale di 250 W e una potenza minima dell'alimentatore di 650 W per l'intero PC. Un alimentatore di qualità da 650 W è adatto; una potenza di 550 W è inferiore alla raccomandazione. Verifica anche i connettori del tuo modello di scheda.
Come verificare che il modello rientri nella VRAM disponibile?+
Dopo il caricamento, esegui ollama ps: la colonna PROCESSOR deve indicare 100 % GPU. Una ripartizione CPU/GPU significa che una parte del modello è nella RAM di sistema, il che rallenta notevolmente la generazione. Riduci quindi il contesto, attiva la cache K/V in q8_0 o scegli un modello più piccolo.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.