Principiante 11 minRTX 30

Quale LLM su RTX 3070 / 3070 Ti (8 GB) ?

Risposta diretta

Una RTX 3070 o 3070 Ti offre 8 GB di VRAM: mantiene nella VRAM i modelli fino a 8–9 miliardi di parametri in Q4 (Granite 4.2 8B da 5,3 GB, Qwen 3.5 9B da 6,6 GB), ma non quelli da 12 miliardi in su. La 3070 Ti, con 608 GB/s contro 448, genera più velocemente a parità di capacità. Nessuna misurazione pubblicata: le velocità di generazione sono stime.

Con 8 GB, la RTX 3070 e la 3070 Ti restano schede valide per un modello di 8 miliardi di parametri, ma la capacità è il loro limite. Questa guida elenca i modelli che rientrano effettivamente in memoria, con il loro peso esatto, i throughput stimati a partire dalla banda passante, i limiti del contesto e le differenze rispetto alle schede di fascia vicina. Saprai anche quando passare a 12 o 16 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RTX 3070 e 3070 Ti per un LLM locale: ciò che permettono 8 GB

Per un LLM locale, il valore di una RTX 3070 o di una 3070 Ti sta nei suoi 8 GB di VRAM, e questa capacità determina tutto: i modelli fino a 8–9 miliardi di parametri in Q4 entrano in memoria, quelli da 12 miliardi in su no. Secondo la libreria Ollama, Granite 4.2 8B pesa 5,3 GB, Qwen3 8B 5,2 GB e Qwen 3.5 9B 6,6 GB; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) superano la capacità della scheda. La 3070 Ti, con 608 GB/s contro i 448 della 3070, genera più velocemente ma ha la stessa capacità.

Memoria
8 GB su un bus da 256 bit: GDDR6 a 448 GB/s per la 3070, GDDR6X a 608 GB/s per la 3070 Ti, secondo la tabella di Wikipedia e NVIDIA.
Calcolo
5 888 core CUDA per la 3070 e 6 144 per la 3070 Ti, secondo Wikipedia.
Consumo
220 W di potenza grafica e un alimentatore da 650 W richiesto per la 3070; 290 W e 750 W per la 3070 Ti, secondo NVIDIA. Sono valori superiori ai 550 W che si leggono talvolta.

#I modelli che rientrano in 8 GB

I pesi sono quelli dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è ciò che rimane degli 8 GB prima di considerare il contesto, la cache e i buffer del motore; deve anche coprire la gestione dello schermo se la scheda lo pilota.

Modelli per RTX 3070 / 3070 Ti (file Ollama, Q4 salvo indicazione)
ModelloFile OllamaMargine lordoVerdetto
Qwen 3.5 4B3,4 GB4,6 GBUtilizzo molto agevole, possibilità di un contesto lungo
Qwen3 8B5,2 GB2,8 GBComodo
Granite 4.2 8B5,3 GB2,7 GBComodo
Qwen 3.5 9B6,6 GB1,4 GBEntra in memoria, contesto da limitare
Gemma 4 12B7,6 GB0,4 GBSenza margine: nessun contesto utile
Qwen3 14B9,3 GBMancano 1,3 GBNon entra
gpt-oss 20B14 GBMancano 6 GBNon entra

Il punto di partenza più sicuro è un modello da 8 miliardi: Granite 4.2 8B o Qwen3 8B lasciano quasi 3 GB per il contesto. Qwen 3.5 9B è il limite superiore nella pratica: 1,4 GB di margine sono sufficienti per una breve conversazione, non per un documento lungo. Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, cioè 6,5 GB in totale con Granite 4.2 8B, e rimangono 1,5 GB per il resto.

#Installare Ollama su una RTX 3070

  1. 01
    Verificare il driver
    Esegui nvidia-smi in un terminale: il driver deve essere alla versione 550 o superiore (551.61 su Windows) e la memoria totale indicata deve essere di circa 8 GB.
  2. 02
    Installare Ollama
    Installa Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
  3. 03
    Avviare un modello
    Esegui ollama run granite4.2:8b: il download di 5,3 GB viene effettuato una sola volta.
  4. 04
    Controllare la distribuzione
    In un secondo terminale, esegui ollama ps: la colonna Processeur deve mostrare 100% GPU. Una ripartizione CPU/GPU significa che il modello o il contesto viene in parte trasferito nella RAM.
  5. 05
    Regolare il contesto
    Imposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio del server per risparmiare VRAM.
Comandi di base
ollama run granite4.2:8b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocità: cosa aspettarsi dalla larghezza di banda

Nessun sito di benchmark di riferimento pubblica una misura per la RTX 3070: i valori qui di seguito sono quindi stime, non misure. Il metodo si basa sul fatto che la generazione è limitata dalla banda passante: il limite teorico equivale approssimativamente alla banda passante divisa per il peso del modello. Per Granite 4.2 8B (5,3 GB), 448 ÷ 5,3 dà 85 token al secondo sulla 3070 e 608 ÷ 5,3 dà 115 sulla 3070 Ti. Per Qwen 3.5 9B (6,6 GB), i limiti sono 68 e 92.

La classifica della comunità di llama.cpp permette di tradurre questi limiti massimi in ordini di grandezza. Con Llama 2 7B Q4_0, una RTX 3060 Ti da 8 GB, scheda con bus a 256 bit simile alla 3070, genera 92,23 token al secondo senza Flash Attention e 96,50 con Flash Attention. Una RTX 3060 da 12 GB, con una banda passante di 360 GB/s, genera 75,57 e 76,92: il rapporto (1,22) segue quello delle bande passanti (448 ÷ 360 = 1,24). Una 3070 dovrebbe quindi fornire velocità simili a quelle della 3060 Ti, intorno ai 90–95 token al secondo su un 7B, e una 3070 Ti circa il 35% in più, cioè 120–130. Sono stime.

Stima della generazione in token al secondo (limite massimo teorico, RTX 3070 / 3070 Ti)
ModelloFile OllamaLimite 3070 (448 GB/s)Limite 3070 Ti (608 GB/s)
Qwen 3.5 4B3,4 GB132179
Granite 4.2 8B5,3 GB85115
Qwen 3.5 9B6,6 GB6892
Gemma 4 12B7,6 GB5980

Le velocità effettive si attestano intorno al 70-80% di questi limiti massimi sulle schede misurate altrove: aspettati quindi da 55 a 65 token al secondo per Granite 4.2 8B su una 3070. Qualunque sia il valore esatto, queste velocità superano la velocità di lettura umana: il limite della 3070 è la capacità, non la velocità.

#I limiti degli 8 GB: contesto, RAG e grandi modelli

Ollama regola il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token con meno di 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, la ricerca web e gli strumenti di programmazione. Con 8 GB, puntare a 64.000 token con un modello da 8 miliardi non è realistico: la cache KV, che memorizza le chiavi e i valori di attenzione di ogni token, consuma il margine disponibile. Secondo la FAQ di Ollama, la quantizzazione q8_0 della cache ne riduce l'occupazione di memoria a circa la metà rispetto a f16, con una perdita di precisione molto bassa: è la prima impostazione da attivare.

Modelli da 12 a 24 miliardi
Gemma 4 12B (7,6 GB) non lascia spazio per il contesto; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) non entrano nella VRAM. Vengono caricati in parte nella RAM e la velocità cala.
Contesto lungo
Con Qwen 3.5 9B, 1,4 GB di margine si esauriscono velocemente: mantieni un contesto di qualche migliaio di token e controlla ollama ps.
RAG a più fasi
Granite 4.2 8B e bge-m3 occupano 6,5 GB: aggiungere un reranker o un secondo modello supera il limite.
Fine-tuning
Secondo Unsloth, il minimo assoluto con QLoRA a 4 bit è di 3,5 GB per 3 miliardi e di 6 GB per 8 miliardi: un modello 8B entra a malapena in memoria, con un batch di 1 e un contesto breve.

Un metodo semplice per restare sotto gli 8 GB consiste in tre impostazioni. Per prima cosa, scegli un modello il cui file lasci almeno 2 GB di margine: Granite 4.2 8B o Qwen3 8B. Poi attiva la cache quantizzata in q8_0 e Flash Attention, che il repository ufficiale di Flash Attention indica come compatibile con le GPU Ampere come la 3070. Infine, aumenta il contesto per livelli successivi, da 4.000 a 8.000 e poi a 16.000 token, eseguendo di nuovo ollama ps a ogni passaggio: non appena compare una quota di utilizzo della CPU, torna al livello precedente. Questa progressione evita di scoprire il limite nel bel mezzo di una conversazione.

#3070 a confronto con le altre schede da 8 a 16 GB

Schede di fascia simile per un LLM locale (NVIDIA, Hardware Corner)
SchedaMemoriaLarghezza di bandaCosa cambia
RTX 30708 GB GDDR6448 GB/sModelli da 8 a 9 miliardi
RTX 3070 Ti8 GB GDDR6X608 GB/sStessa capacità, generazione più veloce
RTX 3060 12 GB12 GB GDDR6360 GB/sAggiunge i modelli da 12 a 14 miliardi
RTX 4060 Ti 16 GB16 GB288 GB/sAggiunge gpt-oss 20B, ma è più lenta

Questa tabella mette in evidenza il compromesso. La 3060 da 12 GB ha una banda passante inferiore del 20% rispetto alla 3070, ma 4 GB in più: può ospitare Qwen3 14B (9,3 GB), che sulla 3070 non entra. La 4060 Ti da 16 GB aggiunge la classe dei modelli da 20 miliardi di parametri, con una banda passante di 288 GB/s che la rende meno veloce sui modelli piccoli. Per un LLM, la capacità ha la precedenza sulla velocità quando il modello desiderato supera i 7,5 GB.

#Verdetto: tenere, sostituire o non acquistare

Quale scelta fare in base alla tua situazione
SituazioneDecisioneMotivazione supportata da dati numerici
Hai già una 3070 e vuoi un 8BTenerlaGranite 4.2 8B : 5,3 GB, circa 60 t/s stimati
Vuoi un modello da 12B a 14BPassare a 12 o 16 GBQwen3 14B pesa 9,3 GB, la 3070 ne ha 8
Vuoi un 20B o un lungo contestoScheda da 16 GB o piùgpt-oss 20B pesa 14 GB
Hai dubbi tra 3070 e 3070 TiPrendi la più economicaStessa capacità, 608 contro 448 GB/s
Cerchi una scheda per iniziareConfrontare con una 3060 da 12 GBPiù memoria per una banda passante simile

La 3070 è una scheda discreta per un modello da 8 miliardi di parametri, ma niente di più. Resta utile come scheda per muovere i primi passi: Ollama la supporta e un modello da 8 miliardi di parametri risponde più velocemente di quanto si riesca a leggere. Non è adatta se prevedi di usare agenti di programmazione o documenti lunghi, che richiedono un contesto per il quale 8 GB non lasciano spazio. Se ce l'hai già, basta per scoprire i LLM locali. Se scegli una scheda per questo solo uso, parti dalla capacità di memoria: un modello più grande che entra in memoria vale più di un modello piccolo più veloce. Per i prezzi del giorno, consulta il nostro monitoraggio, che rileva il prezzo più basso di ogni scheda due volte a settimana.

#Domande frequenti

FAQ
Quale LLM eseguire su una RTX 3070?+
Inizia con Granite 4.2 8B (5,3 GB) o Qwen3 8B (5,2 GB): lasciano quasi 3 GB per il contesto. Qwen 3.5 9B (6,6 GB) è il limite superiore, con 1,4 GB di margine. Oltre 9 miliardi di parametri in Q4, una parte del modello finisce nella RAM di sistema.
La RTX 3070 può eseguire un modello da 14 o 24 miliardi di parametri?+
No. Qwen3 14B pesa 9,3 GB in Ollama, cioè 1,3 GB in più della capacità della scheda, e i modelli da 24 miliardi di parametri (15 GB) o gpt-oss 20B (14 GB) ne richiedono quasi il doppio. Vengono caricati in parte nella RAM e la velocità cala. Servono almeno 12 GB per un modello 14B.
RTX 3070 o RTX 3060 12 GB per un LLM?+
Per un LLM, la 3060 12 GB è spesso la scelta migliore: 4 GB in più permettono di avviare Qwen3 14B (9,3 GB). La 3070 ha 448 GB/s di banda passante contro 360: in teoria genera circa un quarto più velocemente, ma con 8 GB si limita ai modelli da 8 a 9 miliardi di parametri.
Qual è la differenza tra 3070 e 3070 Ti per un LLM?+
Stessa capacità di 8 GB, ma la 3070 Ti ha una memoria GDDR6X a 608 GB/s contro 448 GB/s in GDDR6, cioè il 36% di banda passante in più. La generazione, limitata dalla banda passante, migliora nelle stesse proporzioni in teoria. La Ti consuma 290 W contro 220 W secondo NVIDIA.
Quale alimentatore per una RTX 3070 Ti?+
NVIDIA indica un alimentatore di sistema richiesto da 750 W per la 3070 Ti (290 W di potenza grafica) e da 650 W per la 3070 (220 W). Sono i valori del produttore per un PC completo: un alimentatore da 550 W è al di sotto di questa raccomandazione, anche se può bastare su un PC a basso consumo.
È possibile fare fine-tuning su un modello con una RTX 3070?+
Sì, con QLoRA su modelli piccoli. Secondo Unsloth, il minimo assoluto è di 3,5 GB per un 3B e di 6 GB per un 8B: con 8 GB, un 8B entra a malapena in memoria, con un batch di 1 e un contesto breve. Un 14B richiede 8,5 GB e non entra in memoria.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.