Quale LLM su RTX 3070 / 3070 Ti (8 GB) ?
Una RTX 3070 o 3070 Ti offre 8 GB di VRAM: mantiene nella VRAM i modelli fino a 8–9 miliardi di parametri in Q4 (Granite 4.2 8B da 5,3 GB, Qwen 3.5 9B da 6,6 GB), ma non quelli da 12 miliardi in su. La 3070 Ti, con 608 GB/s contro 448, genera più velocemente a parità di capacità. Nessuna misurazione pubblicata: le velocità di generazione sono stime.
Con 8 GB, la RTX 3070 e la 3070 Ti restano schede valide per un modello di 8 miliardi di parametri, ma la capacità è il loro limite. Questa guida elenca i modelli che rientrano effettivamente in memoria, con il loro peso esatto, i throughput stimati a partire dalla banda passante, i limiti del contesto e le differenze rispetto alle schede di fascia vicina. Saprai anche quando passare a 12 o 16 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RTX 3070 e 3070 Ti per un LLM locale: ciò che permettono 8 GB
Per un LLM locale, il valore di una RTX 3070 o di una 3070 Ti sta nei suoi 8 GB di VRAM, e questa capacità determina tutto: i modelli fino a 8–9 miliardi di parametri in Q4 entrano in memoria, quelli da 12 miliardi in su no. Secondo la libreria Ollama, Granite 4.2 8B pesa 5,3 GB, Qwen3 8B 5,2 GB e Qwen 3.5 9B 6,6 GB; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) superano la capacità della scheda. La 3070 Ti, con 608 GB/s contro i 448 della 3070, genera più velocemente ma ha la stessa capacità.
- Memoria
- 8 GB su un bus da 256 bit: GDDR6 a 448 GB/s per la 3070, GDDR6X a 608 GB/s per la 3070 Ti, secondo la tabella di Wikipedia e NVIDIA.
- Calcolo
- 5 888 core CUDA per la 3070 e 6 144 per la 3070 Ti, secondo Wikipedia.
- Consumo
- 220 W di potenza grafica e un alimentatore da 650 W richiesto per la 3070; 290 W e 750 W per la 3070 Ti, secondo NVIDIA. Sono valori superiori ai 550 W che si leggono talvolta.
#I modelli che rientrano in 8 GB
I pesi sono quelli dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è ciò che rimane degli 8 GB prima di considerare il contesto, la cache e i buffer del motore; deve anche coprire la gestione dello schermo se la scheda lo pilota.
| Modello | File Ollama | Margine lordo | Verdetto |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Utilizzo molto agevole, possibilità di un contesto lungo |
| Qwen3 8B | 5,2 GB | 2,8 GB | Comodo |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Comodo |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Entra in memoria, contesto da limitare |
| Gemma 4 12B | 7,6 GB | 0,4 GB | Senza margine: nessun contesto utile |
| Qwen3 14B | 9,3 GB | Mancano 1,3 GB | Non entra |
| gpt-oss 20B | 14 GB | Mancano 6 GB | Non entra |
Il punto di partenza più sicuro è un modello da 8 miliardi: Granite 4.2 8B o Qwen3 8B lasciano quasi 3 GB per il contesto. Qwen 3.5 9B è il limite superiore nella pratica: 1,4 GB di margine sono sufficienti per una breve conversazione, non per un documento lungo. Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, cioè 6,5 GB in totale con Granite 4.2 8B, e rimangono 1,5 GB per il resto.
#Installare Ollama su una RTX 3070
- 01Verificare il driverEsegui nvidia-smi in un terminale: il driver deve essere alla versione 550 o superiore (551.61 su Windows) e la memoria totale indicata deve essere di circa 8 GB.
- 02Installare OllamaInstalla Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
- 03Avviare un modelloEsegui ollama run granite4.2:8b: il download di 5,3 GB viene effettuato una sola volta.
- 04Controllare la distribuzioneIn un secondo terminale, esegui ollama ps: la colonna Processeur deve mostrare 100% GPU. Una ripartizione CPU/GPU significa che il modello o il contesto viene in parte trasferito nella RAM.
- 05Regolare il contestoImposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio del server per risparmiare VRAM.
#Velocità: cosa aspettarsi dalla larghezza di banda
Nessun sito di benchmark di riferimento pubblica una misura per la RTX 3070: i valori qui di seguito sono quindi stime, non misure. Il metodo si basa sul fatto che la generazione è limitata dalla banda passante: il limite teorico equivale approssimativamente alla banda passante divisa per il peso del modello. Per Granite 4.2 8B (5,3 GB), 448 ÷ 5,3 dà 85 token al secondo sulla 3070 e 608 ÷ 5,3 dà 115 sulla 3070 Ti. Per Qwen 3.5 9B (6,6 GB), i limiti sono 68 e 92.
La classifica della comunità di llama.cpp permette di tradurre questi limiti massimi in ordini di grandezza. Con Llama 2 7B Q4_0, una RTX 3060 Ti da 8 GB, scheda con bus a 256 bit simile alla 3070, genera 92,23 token al secondo senza Flash Attention e 96,50 con Flash Attention. Una RTX 3060 da 12 GB, con una banda passante di 360 GB/s, genera 75,57 e 76,92: il rapporto (1,22) segue quello delle bande passanti (448 ÷ 360 = 1,24). Una 3070 dovrebbe quindi fornire velocità simili a quelle della 3060 Ti, intorno ai 90–95 token al secondo su un 7B, e una 3070 Ti circa il 35% in più, cioè 120–130. Sono stime.
| Modello | File Ollama | Limite 3070 (448 GB/s) | Limite 3070 Ti (608 GB/s) |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 | 179 |
| Granite 4.2 8B | 5,3 GB | 85 | 115 |
| Qwen 3.5 9B | 6,6 GB | 68 | 92 |
| Gemma 4 12B | 7,6 GB | 59 | 80 |
Le velocità effettive si attestano intorno al 70-80% di questi limiti massimi sulle schede misurate altrove: aspettati quindi da 55 a 65 token al secondo per Granite 4.2 8B su una 3070. Qualunque sia il valore esatto, queste velocità superano la velocità di lettura umana: il limite della 3070 è la capacità, non la velocità.
#I limiti degli 8 GB: contesto, RAG e grandi modelli
Ollama regola il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token con meno di 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, la ricerca web e gli strumenti di programmazione. Con 8 GB, puntare a 64.000 token con un modello da 8 miliardi non è realistico: la cache KV, che memorizza le chiavi e i valori di attenzione di ogni token, consuma il margine disponibile. Secondo la FAQ di Ollama, la quantizzazione q8_0 della cache ne riduce l'occupazione di memoria a circa la metà rispetto a f16, con una perdita di precisione molto bassa: è la prima impostazione da attivare.
- Modelli da 12 a 24 miliardi
- Gemma 4 12B (7,6 GB) non lascia spazio per il contesto; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) non entrano nella VRAM. Vengono caricati in parte nella RAM e la velocità cala.
- Contesto lungo
- Con Qwen 3.5 9B, 1,4 GB di margine si esauriscono velocemente: mantieni un contesto di qualche migliaio di token e controlla ollama ps.
- RAG a più fasi
- Granite 4.2 8B e bge-m3 occupano 6,5 GB: aggiungere un reranker o un secondo modello supera il limite.
- Fine-tuning
- Secondo Unsloth, il minimo assoluto con QLoRA a 4 bit è di 3,5 GB per 3 miliardi e di 6 GB per 8 miliardi: un modello 8B entra a malapena in memoria, con un batch di 1 e un contesto breve.
Un metodo semplice per restare sotto gli 8 GB consiste in tre impostazioni. Per prima cosa, scegli un modello il cui file lasci almeno 2 GB di margine: Granite 4.2 8B o Qwen3 8B. Poi attiva la cache quantizzata in q8_0 e Flash Attention, che il repository ufficiale di Flash Attention indica come compatibile con le GPU Ampere come la 3070. Infine, aumenta il contesto per livelli successivi, da 4.000 a 8.000 e poi a 16.000 token, eseguendo di nuovo ollama ps a ogni passaggio: non appena compare una quota di utilizzo della CPU, torna al livello precedente. Questa progressione evita di scoprire il limite nel bel mezzo di una conversazione.
#3070 a confronto con le altre schede da 8 a 16 GB
| Scheda | Memoria | Larghezza di banda | Cosa cambia |
|---|---|---|---|
| RTX 3070 | 8 GB GDDR6 | 448 GB/s | Modelli da 8 a 9 miliardi |
| RTX 3070 Ti | 8 GB GDDR6X | 608 GB/s | Stessa capacità, generazione più veloce |
| RTX 3060 12 GB | 12 GB GDDR6 | 360 GB/s | Aggiunge i modelli da 12 a 14 miliardi |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | Aggiunge gpt-oss 20B, ma è più lenta |
Questa tabella mette in evidenza il compromesso. La 3060 da 12 GB ha una banda passante inferiore del 20% rispetto alla 3070, ma 4 GB in più: può ospitare Qwen3 14B (9,3 GB), che sulla 3070 non entra. La 4060 Ti da 16 GB aggiunge la classe dei modelli da 20 miliardi di parametri, con una banda passante di 288 GB/s che la rende meno veloce sui modelli piccoli. Per un LLM, la capacità ha la precedenza sulla velocità quando il modello desiderato supera i 7,5 GB.
#Verdetto: tenere, sostituire o non acquistare
| Situazione | Decisione | Motivazione supportata da dati numerici |
|---|---|---|
| Hai già una 3070 e vuoi un 8B | Tenerla | Granite 4.2 8B : 5,3 GB, circa 60 t/s stimati |
| Vuoi un modello da 12B a 14B | Passare a 12 o 16 GB | Qwen3 14B pesa 9,3 GB, la 3070 ne ha 8 |
| Vuoi un 20B o un lungo contesto | Scheda da 16 GB o più | gpt-oss 20B pesa 14 GB |
| Hai dubbi tra 3070 e 3070 Ti | Prendi la più economica | Stessa capacità, 608 contro 448 GB/s |
| Cerchi una scheda per iniziare | Confrontare con una 3060 da 12 GB | Più memoria per una banda passante simile |
La 3070 è una scheda discreta per un modello da 8 miliardi di parametri, ma niente di più. Resta utile come scheda per muovere i primi passi: Ollama la supporta e un modello da 8 miliardi di parametri risponde più velocemente di quanto si riesca a leggere. Non è adatta se prevedi di usare agenti di programmazione o documenti lunghi, che richiedono un contesto per il quale 8 GB non lasciano spazio. Se ce l'hai già, basta per scoprire i LLM locali. Se scegli una scheda per questo solo uso, parti dalla capacità di memoria: un modello più grande che entra in memoria vale più di un modello piccolo più veloce. Per i prezzi del giorno, consulta il nostro monitoraggio, che rileva il prezzo più basso di ogni scheda due volte a settimana.
- Fonte: NVIDIA, specifiche RTX 3070 e 3070 Ti
- Fonte: classifica della comunità llama.cpp su CUDA
- Fonte: documentazione di Ollama, lunghezza del contesto
- Fonte: FAQ di Ollama, Flash Attention e cache KV
- Fonte: Unsloth, VRAM richiesta per il fine-tuning
#Domande frequenti
Quale LLM eseguire su una RTX 3070?+
La RTX 3070 può eseguire un modello da 14 o 24 miliardi di parametri?+
RTX 3070 o RTX 3060 12 GB per un LLM?+
Qual è la differenza tra 3070 e 3070 Ti per un LLM?+
Quale alimentatore per una RTX 3070 Ti?+
È possibile fare fine-tuning su un modello con una RTX 3070?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.