Intermedio 13 minRTX 30

Quale LLM su RTX 3090 / 3090 Ti (24 GB) ?

Risposta diretta

Una RTX 3090 offre 24 GB di VRAM e 936 GB/s di banda passante: abbastanza per eseguire in Q4 modelli densi da 27 a 32 miliardi di parametri (Qwen 3.5 27B, Qwen3 32B, Gemma 4 31B) e modelli a esperti come gpt-oss 20B. La 3090 Ti offre solo il 6–8% di velocità in più. Un modello 70B non entra nella memoria di una sola scheda.

Con 24 GB, la RTX 3090 e la 3090 Ti mantengono in VRAM un modello denso da 27 a 32 miliardi di parametri, cosa che le schede da 12 e 16 GB non permettono. Questa guida elenca i modelli che entrano effettivamente in memoria, con il loro peso esatto, i dati di throughput misurati da Hardware Corner, l'effetto del contesto, il limite di potenza che riduce il consumo e i punti da controllare prima di acquistare. Saprai anche quando preferire una 4090 o una 5090.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 3090 per un LLM locale: cosa permettono 24 GB

Per un LLM locale, una RTX 3090 vale prima di tutto per i suoi 24 GB di GDDR6X e i suoi 936 GB/s di larghezza di banda: mantiene interamente in VRAM modelli da 27 a 32 miliardi di parametri in Q4, che le schede da 12 e 16 GB non possono contenere. Secondo la libreria Ollama, Qwen 3.5 27B pesa 17 GB, Qwen 3.8 27B 18 GB, Qwen3 32B e Gemma 4 31B 20 GB. Hardware Corner misura circa 33–35 token al secondo su questi modelli densi con 4 000 token di contesto, e oltre 100 su modelli a esperti come gpt-oss 20B. Un 70B in Q4 (43 GB per Llama 3.3) resta fuori dalla portata di una singola scheda. La 3090 Ti aggiunge solo l'8 % di larghezza di banda.

Memoria
24 GB di GDDR6X su un bus da 384 bit; 936 GB/s per la 3090 e 1.008 GB/s per la 3090 Ti, secondo la tabella di Wikipedia.
Consumo
350 W di potenza grafica per la 3090, 450 W per la Ti; alimentatore di sistema richiesto da 750 W per la 3090 e da 850 W per la Ti, secondo NVIDIA.
Software
Ollama elenca la RTX 3090 tra le schede con capacità di calcolo 8.6, supportate con un driver 550 o successivo.
i
In rete circola un valore di larghezza di banda di 986 GB/s
Alcune pagine di benchmark citano 986 GB/s per la 3090. Il valore derivante dal bus di 384 bit e dalla memoria a 19,5 Gbit/s è di 936 GB/s (384 × 19,5 ÷ 8), quello riportato nella tabella di Wikipedia. È questo il valore utilizzato in questa guida.

#I modelli che stanno in 24 GB

Le dimensioni riportate qui sotto sono quelle dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è ciò che resta dei 24 GB prima di allocare memoria per il contesto, la cache e i buffer del motore: lascia spazio anche per il sistema se la scheda gestisce il tuo schermo.

Modelli per RTX 3090 / 3090 Ti (file Ollama, Q4 salvo diversa indicazione)
ModelloFile OllamaMargine lordoCosa offre
gpt-oss 20B14 GB10 GBRagionamento rapido, contesto lungo possibile
Devstral Small 2 24B15 GB9 GBCodice e agenti
Qwen 3.5 27B17 GB7 GBModello denso e versatile, testo e immagini
Qwen 3.8 27B18 GB6 GBGenerazione recente, 27B denso
Qwen3-Coder 30B19 GB5 GBCodice, modello a miscela di esperti
Gemma 4 26B19 GB5 GBModello a esperti, alto throughput
Qwen3 32B / Gemma 4 31B20 GB4 GBLimite superiore dei modelli densi
Qwen 3.5 35B24 GB0 GBNon entra in memoria in Q4: impossibile gestire il contesto
Llama 3.3 70B43 GBMancano 19 GBFuori portata di una sola scheda

Parti da un modello denso da 27 miliardi: Qwen 3.5 27B lascia 7 GB per il contesto. Superati i 20 GB, il margine diventa troppo stretto per un contesto utile. I modelli con esperti (Qwen3-Coder 30B, Gemma 4 26B, gpt-oss 20B) vanno molto più veloci dei modelli densi perché ogni token attiva solo una parte dei pesi.

#Contesto e cache KV: il vantaggio dei 24 GB

Ollama imposta il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token sotto i 24 GiB di VRAM e 32k token tra 24 e 48 GiB. Una RTX 3090 si trova al limite tra le due fasce: a seconda della memoria che la scheda comunica al motore, ottieni 32k o 4k, e un agente avviato con le impostazioni predefinite può perdere la propria cronologia senza preavviso. Controlla il valore effettivo con ollama ps e impostalo tu stesso per gli agenti, per i quali la documentazione raccomanda almeno 64.000 token.

La cache KV ha un costo in termini di memoria: ogni token di contesto memorizza chiavi e valori di attenzione. La leva principale è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16, con una perdita di precisione molto bassa. Il contesto ha un costo anche in termini di velocità: Hardware Corner passa da 70 a 52 e poi a 39 token al secondo su Qwen3 14B, passando da 4k a 16k e poi a 32k.

Lettura del prompt e generazione su RTX 3090, token al secondo (Hardware Corner, misurazioni di terze parti)
Modello (Q4_K, o MXFP4 per gpt-oss)Generazione 4kGenerazione 16kGenerazione 32kLettura prompt 4kLettura del prompt 32k
Qwen3 8B115,387,567,94 049,61 714,6
Qwen3 14B70,052,138,62 459,01 175,7
gpt-oss 20B147,5128,5112,64 400,32 547,2
Qwen3 30B A3B153,6113,887,22 988,61 336,8
Qwen 3.5 27B33,532,331,01 104,2848,2
Gemma 4 31B34,733,531,41 155,8723,7

Si distinguono due comportamenti. I modelli classici come Qwen3 14B perdono quasi la metà del loro throughput tra 4k e 32k. Qwen 3.5 27B, invece, perde solo il 7 % nello stesso intervallo (da 33,5 a 31,0). La fonte non ne dà la causa, ma per documenti lunghi questo comportamento conta di più della dimensione del modello. Questi dati provengono da Hardware Corner, non da misurazioni di QuelLLM.

#Installare Ollama e verificare che il modello rientri nella memoria disponibile

La 3090 è una scheda Ampere con capacità di calcolo (compute capability) 8.6, supportata da Ollama con un driver NVIDIA 550 o successivo; su Windows, la documentazione richiede la versione 551.61 o successiva. Flash Attention 2, che riduce la memoria necessaria per il contesto, funziona su Ampere secondo il suo repository ufficiale; la versione 3 è riservata a Hopper (H100) e non è disponibile su una 3090.

  1. 01
    Verificare il driver
    Esegui nvidia-smi in un terminale: la versione del driver deve essere 550 o superiore (551.61 su Windows) e la memoria totale indicata deve essere di circa 24 GB.
  2. 02
    Installare Ollama
    Installa Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
  3. 03
    Avviare un modello da 27 miliardi
    Esegui ollama run qwen3.5:27b : il download di 17 GB avviene una volta. Per un modello più veloce, prova ollama run gpt-oss:20b (14 GB).
  4. 04
    Controllare la distribuzione della memoria
    In un secondo terminale, esegui ollama ps: la colonna Processeur deve mostrare 100 % GPU. Una ripartizione CPU/GPU significa che il modello o il suo contesto viene caricato in parte nella RAM di sistema.
  5. 05
    Regolare il contesto
    Imposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se manca margine, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio del server.
Comandi di base
ollama run qwen3.5:27b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocità di elaborazione: ciò che la larghezza di banda permette davvero

La generazione è limitata dalla banda passante: la GPU rilegge tutti i pesi attivi per ogni token, quindi il limite teorico è pari, approssimativamente, alla banda passante divisa per il peso del modello. Con 936 GB/s, Qwen3 14B (9,3 GB) ha un limite teorico di circa 100 token al secondo e Hardware Corner ne misura 70,0 a 4k, pari al 70%. Qwen 3.5 27B (17 GB) ha un limite teorico di 55 e un valore misurato di 33,5: il 61%. Qwen3 32B (20 GB) ha un limite teorico di 47 e un valore misurato di 35,1: il 75%. Un modello denso da 27B o 32B funziona quindi a circa il 60-75% del proprio limite teorico, ossia 33-35 token al secondo, una velocità che resta molto comoda per la lettura.

La classifica della community di llama.cpp conferma la parentela tra le due schede. Su Llama 2 7B Q4_0 (3,56 GiB), la 3090 genera 158,16 token al secondo senza Flash Attention e 161,89 con Flash Attention, contro rispettivamente 171,19 e 172,26 per la 3090 Ti: un vantaggio del +8 % e del +6 %, coerente con l'8 % di banda passante in più. Le due serie provengono da contributori diversi, quindi la differenza reale dipende dalla macchina.

→
Il prompt conta quanto la generazione
La lettura del prompt dipende dal calcolo, non dalla banda passante. Su Qwen 3.5 27B, Hardware Corner segnala 1 104 token al secondo a 4k e 848 a 32k: un documento di 32 000 token viene letto in una quarantina di secondi. Per un agente che invia grandi contesti a ogni turno, questo ritardo pesa di più della velocità di generazione.

#Raffreddamento, limite di potenza e acquisto usato

La 3090 consuma 350 W e la Ti 450 W, con una temperatura massima della GPU rispettivamente di 93 e 92 °C secondo NVIDIA. Sotto un carico LLM prolungato, il rumore e il calore del case contano: prevedi un case ben ventilato e un alimentatore che soddisfi i requisiti di 750 W (3090) o 850 W (Ti) indicati da NVIDIA. Un LLM sollecita soprattutto la memoria: limitare la potenza comporta una perdita di velocità ridotta.

La classifica di llama.cpp fornisce un ordine di grandezza: un contributore limita la propria 3090 a 250 W e rileva 137,72 token al secondo su Llama 2 7B Q4_0, contro 158,16 nella serie con impostazioni di fabbrica. È circa il 13 % di velocità in meno per il 29 % di potenza in meno. Le due misurazioni provengono da macchine diverse: prendile come indicazione, poi misura sul tuo sistema.

Limitare la potenza (sono richiesti privilegi di amministratore)
sudo nvidia-smi -pl 250

L'opzione -pl di nvidia-smi imposta la potenza massima in watt. Su Windows, apri il terminale come amministratore; l'impostazione scompare al riavvio a meno che non sia automatizzata. Su una scheda usata, controlla anche la temperatura della memoria con uno strumento come HWiNFO: se sale nettamente al di sopra di quella del core, è da considerare la sostituzione dei pad termici.

#Acquistare una 3090 di seconda mano: cosa verificare

La 3090 è una scheda Ampere che si trova soprattutto di seconda mano. Per i prezzi attuali, consulta il nostro monitoraggio, che segnala il prezzo più basso di ogni scheda due volte a settimana, con il prezzo per GB di VRAM.

Identità
Verifica con nvidia-smi che la scheda mostri 24 GB e il modello corretto (3090 o 3090 Ti), non un altro modello.
Stabilità
Esegui un modello da 27 miliardi in loop per una trentina di minuti: crash, artefatti o limitazioni delle prestazioni dovute al calore sono segnali di allarme.
Temperatura della memoria
Confronta la temperatura della memoria con quella del core: una differenza notevole indica pad termici usurati.
Garanzia
Esigi la possibilità di reso o una garanzia del venditore: la sostituzione dei pad o della pasta termica è un costo da prevedere.
Alimentazione
350 W o 450 W di picco: controlla l'alimentatore e i connettori di alimentazione della scheda prima dell'acquisto.

#3090, 4090, 5090: cosa si guadagna pagando di più?

Anche la RTX 4090 offre 24 GB, con una maggiore potenza di calcolo: il suo vantaggio riguarda più l'elaborazione del prompt che la generazione, che rimane limitata dalla banda passante. La RTX 5090 passa a 32 GB, una categoria in cui un modello denso da 32B conserva un margine per un contesto lungo. Le guide dedicate a queste due schede descrivono ogni caso in dettaglio.

#vLLM, due schede e fine-tuning su 3090

Tre utilizzi ricorrono spesso con la 3090. vLLM funziona: secondo la sua documentazione richiede una compute capability pari o superiore a 7.5, mentre quella della 3090 è 8.6. Per scegliere tra llama.cpp e vLLM, consulta il confronto tra i motori. Due 3090 possono essere combinate tramite un ponte NVLink per le schede della serie 30: la guida multi-GPU descrive in dettaglio la ripartizione dei layer.

Per il fine-tuning, Unsloth indica requisiti minimi di VRAM in QLoRA a 4 bit: 6 GB per un modello di 8 miliardi di parametri, 8,5 GB per 14 miliardi, 22 GB per 27 miliardi e 26 GB per 32 miliardi. La 3090 permette quindi di effettuare il fine-tuning di modelli fino a 27B in QLoRA, appena, con un batch di 1 e un contesto breve, ma non di un modello da 32B. In LoRA a 16 bit, 9 miliardi richiedono già 24 GB, cioè tutta la memoria della scheda.

#Verdetto: in quali casi la 3090 rimane la scelta giusta

Quale scelta fare in base alla tua situazione
SituazioneDecisioneMotivazione supportata da dati numerici
Vuoi eseguire in locale un modello denso da 27B o 32B3090 (o 4090)24 GB: da 17 a 20 GB di pesi e da 4 a 7 GB di margine
Punti soprattutto a modelli da 7 a 14 miliardiUna scheda da 12 o 16 GB bastaLa 3090 offre solo velocità: 936 GB/s
Vuoi un 70B o contesti molto lunghi5090 o due schede43 GB di pesi per un 70B Q4
Il silenzio e il consumo vanno prima di tuttoUna scheda recente da 16 GBAlimentatore da 750 W richiesto per la 3090
Sei indeciso tra 3090 e 3090 TiPrendi la meno costosa delle dueSolo dal +6 al +8 % nella generazione

La 3090 rimane la scelta di partenza più comune per un modello 27B in locale: è la conclusione di Hardware Corner, che la considera la migliore opzione sul mercato dell'usato per iniziare a farne un uso serio. La 4090 la sostituisce se il budget lo permette, la 5090 se vuoi 32 GB.

#Domande frequenti

FAQ
Quale LLM eseguire su una RTX 3090?+
Comincia con Qwen 3.5 27B: il suo file Ollama da 17 GB lascia circa 7 GB di margine per il contesto e genera circa 33 token al secondo, stando a Hardware Corner. Per una maggiore velocità, gpt-oss 20B (14 GB) supera i 100 token al secondo. Qwen3 32B e Gemma 4 31B (20 GB) sono la soglia massima.
Una RTX 3090 può eseguire un 70B?+
No, non interamente. Llama 3.3 70B occupa 43 GB in Ollama, cioè 19 GB in più della memoria della scheda. Se viene ripartito tra la memoria della scheda e la RAM, diventa molto lento, perché per ogni token vengono riletti tutti i pesi. Per tenere un 70B in VRAM, servono due schede da 24 GB o una scheda con più di 43 GB di memoria.
RTX 3090 o 3090 Ti per un LLM locale?+
Si equivalgono quasi: entrambe hanno 24 GB di memoria, una larghezza di banda di 936 contro 1.008 GB/s e un guadagno nella generazione dal 6 all'8% nella classifica di llama.cpp. La Ti consuma 450 W contro 350 W. Salvo una differenza di prezzo minima, la 3090 è la scelta migliore.
Quale alimentatore per una RTX 3090?+
NVIDIA indica un alimentatore di sistema da 750 W per la 3090 (350 W di potenza grafica) e da 850 W per la 3090 Ti (450 W). Questi valori si riferiscono a un PC completo. Un limite a 250 W riduce il consumo della scheda al prezzo di una velocità inferiore di circa il 13%, secondo una misurazione della community.
La RTX 3090 supporta vLLM e Flash Attention?+
Sì a entrambi. vLLM richiede una capacità di calcolo di almeno 7.5 e la 3090 ha una capacità di calcolo di 8.6. Flash Attention 2 funziona sulle GPU Ampere, tra cui la 3090, secondo il suo repository ufficiale. Flash Attention 3 è invece riservato a Hopper: non cercarlo su una scheda Ampere di fascia consumer.
È possibile eseguire il fine-tuning di un modello su una RTX 3090?+
Sì, in QLoRA. Secondo Unsloth, il minimo è di 22 GB per un modello da 27B e di 8,5 GB per un modello da 14B, il che rende il 27B appena fattibile con un batch di 1. Un modello da 32B richiede 26 GB e non entra in memoria. In LoRA a 16 bit, il limite pratico è intorno a 9 miliardi.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.