Quale LLM su RTX 3090 / 3090 Ti (24 GB) ?
Una RTX 3090 offre 24 GB di VRAM e 936 GB/s di banda passante: abbastanza per eseguire in Q4 modelli densi da 27 a 32 miliardi di parametri (Qwen 3.5 27B, Qwen3 32B, Gemma 4 31B) e modelli a esperti come gpt-oss 20B. La 3090 Ti offre solo il 6–8% di velocità in più. Un modello 70B non entra nella memoria di una sola scheda.
Con 24 GB, la RTX 3090 e la 3090 Ti mantengono in VRAM un modello denso da 27 a 32 miliardi di parametri, cosa che le schede da 12 e 16 GB non permettono. Questa guida elenca i modelli che entrano effettivamente in memoria, con il loro peso esatto, i dati di throughput misurati da Hardware Corner, l'effetto del contesto, il limite di potenza che riduce il consumo e i punti da controllare prima di acquistare. Saprai anche quando preferire una 4090 o una 5090.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 3090 per un LLM locale: cosa permettono 24 GB
Per un LLM locale, una RTX 3090 vale prima di tutto per i suoi 24 GB di GDDR6X e i suoi 936 GB/s di larghezza di banda: mantiene interamente in VRAM modelli da 27 a 32 miliardi di parametri in Q4, che le schede da 12 e 16 GB non possono contenere. Secondo la libreria Ollama, Qwen 3.5 27B pesa 17 GB, Qwen 3.8 27B 18 GB, Qwen3 32B e Gemma 4 31B 20 GB. Hardware Corner misura circa 33–35 token al secondo su questi modelli densi con 4 000 token di contesto, e oltre 100 su modelli a esperti come gpt-oss 20B. Un 70B in Q4 (43 GB per Llama 3.3) resta fuori dalla portata di una singola scheda. La 3090 Ti aggiunge solo l'8 % di larghezza di banda.
- Memoria
- 24 GB di GDDR6X su un bus da 384 bit; 936 GB/s per la 3090 e 1.008 GB/s per la 3090 Ti, secondo la tabella di Wikipedia.
- Consumo
- 350 W di potenza grafica per la 3090, 450 W per la Ti; alimentatore di sistema richiesto da 750 W per la 3090 e da 850 W per la Ti, secondo NVIDIA.
- Software
- Ollama elenca la RTX 3090 tra le schede con capacità di calcolo 8.6, supportate con un driver 550 o successivo.
#I modelli che stanno in 24 GB
Le dimensioni riportate qui sotto sono quelle dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è ciò che resta dei 24 GB prima di allocare memoria per il contesto, la cache e i buffer del motore: lascia spazio anche per il sistema se la scheda gestisce il tuo schermo.
| Modello | File Ollama | Margine lordo | Cosa offre |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 10 GB | Ragionamento rapido, contesto lungo possibile |
| Devstral Small 2 24B | 15 GB | 9 GB | Codice e agenti |
| Qwen 3.5 27B | 17 GB | 7 GB | Modello denso e versatile, testo e immagini |
| Qwen 3.8 27B | 18 GB | 6 GB | Generazione recente, 27B denso |
| Qwen3-Coder 30B | 19 GB | 5 GB | Codice, modello a miscela di esperti |
| Gemma 4 26B | 19 GB | 5 GB | Modello a esperti, alto throughput |
| Qwen3 32B / Gemma 4 31B | 20 GB | 4 GB | Limite superiore dei modelli densi |
| Qwen 3.5 35B | 24 GB | 0 GB | Non entra in memoria in Q4: impossibile gestire il contesto |
| Llama 3.3 70B | 43 GB | Mancano 19 GB | Fuori portata di una sola scheda |
Parti da un modello denso da 27 miliardi: Qwen 3.5 27B lascia 7 GB per il contesto. Superati i 20 GB, il margine diventa troppo stretto per un contesto utile. I modelli con esperti (Qwen3-Coder 30B, Gemma 4 26B, gpt-oss 20B) vanno molto più veloci dei modelli densi perché ogni token attiva solo una parte dei pesi.
#Contesto e cache KV: il vantaggio dei 24 GB
Ollama imposta il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token sotto i 24 GiB di VRAM e 32k token tra 24 e 48 GiB. Una RTX 3090 si trova al limite tra le due fasce: a seconda della memoria che la scheda comunica al motore, ottieni 32k o 4k, e un agente avviato con le impostazioni predefinite può perdere la propria cronologia senza preavviso. Controlla il valore effettivo con ollama ps e impostalo tu stesso per gli agenti, per i quali la documentazione raccomanda almeno 64.000 token.
La cache KV ha un costo in termini di memoria: ogni token di contesto memorizza chiavi e valori di attenzione. La leva principale è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16, con una perdita di precisione molto bassa. Il contesto ha un costo anche in termini di velocità: Hardware Corner passa da 70 a 52 e poi a 39 token al secondo su Qwen3 14B, passando da 4k a 16k e poi a 32k.
| Modello (Q4_K, o MXFP4 per gpt-oss) | Generazione 4k | Generazione 16k | Generazione 32k | Lettura prompt 4k | Lettura del prompt 32k |
|---|---|---|---|---|---|
| Qwen3 8B | 115,3 | 87,5 | 67,9 | 4 049,6 | 1 714,6 |
| Qwen3 14B | 70,0 | 52,1 | 38,6 | 2 459,0 | 1 175,7 |
| gpt-oss 20B | 147,5 | 128,5 | 112,6 | 4 400,3 | 2 547,2 |
| Qwen3 30B A3B | 153,6 | 113,8 | 87,2 | 2 988,6 | 1 336,8 |
| Qwen 3.5 27B | 33,5 | 32,3 | 31,0 | 1 104,2 | 848,2 |
| Gemma 4 31B | 34,7 | 33,5 | 31,4 | 1 155,8 | 723,7 |
Si distinguono due comportamenti. I modelli classici come Qwen3 14B perdono quasi la metà del loro throughput tra 4k e 32k. Qwen 3.5 27B, invece, perde solo il 7 % nello stesso intervallo (da 33,5 a 31,0). La fonte non ne dà la causa, ma per documenti lunghi questo comportamento conta di più della dimensione del modello. Questi dati provengono da Hardware Corner, non da misurazioni di QuelLLM.
#Installare Ollama e verificare che il modello rientri nella memoria disponibile
La 3090 è una scheda Ampere con capacità di calcolo (compute capability) 8.6, supportata da Ollama con un driver NVIDIA 550 o successivo; su Windows, la documentazione richiede la versione 551.61 o successiva. Flash Attention 2, che riduce la memoria necessaria per il contesto, funziona su Ampere secondo il suo repository ufficiale; la versione 3 è riservata a Hopper (H100) e non è disponibile su una 3090.
- 01Verificare il driverEsegui nvidia-smi in un terminale: la versione del driver deve essere 550 o superiore (551.61 su Windows) e la memoria totale indicata deve essere di circa 24 GB.
- 02Installare OllamaInstalla Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
- 03Avviare un modello da 27 miliardiEsegui ollama run qwen3.5:27b : il download di 17 GB avviene una volta. Per un modello più veloce, prova ollama run gpt-oss:20b (14 GB).
- 04Controllare la distribuzione della memoriaIn un secondo terminale, esegui ollama ps: la colonna Processeur deve mostrare 100 % GPU. Una ripartizione CPU/GPU significa che il modello o il suo contesto viene caricato in parte nella RAM di sistema.
- 05Regolare il contestoImposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se manca margine, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio del server.
#Velocità di elaborazione: ciò che la larghezza di banda permette davvero
La generazione è limitata dalla banda passante: la GPU rilegge tutti i pesi attivi per ogni token, quindi il limite teorico è pari, approssimativamente, alla banda passante divisa per il peso del modello. Con 936 GB/s, Qwen3 14B (9,3 GB) ha un limite teorico di circa 100 token al secondo e Hardware Corner ne misura 70,0 a 4k, pari al 70%. Qwen 3.5 27B (17 GB) ha un limite teorico di 55 e un valore misurato di 33,5: il 61%. Qwen3 32B (20 GB) ha un limite teorico di 47 e un valore misurato di 35,1: il 75%. Un modello denso da 27B o 32B funziona quindi a circa il 60-75% del proprio limite teorico, ossia 33-35 token al secondo, una velocità che resta molto comoda per la lettura.
La classifica della community di llama.cpp conferma la parentela tra le due schede. Su Llama 2 7B Q4_0 (3,56 GiB), la 3090 genera 158,16 token al secondo senza Flash Attention e 161,89 con Flash Attention, contro rispettivamente 171,19 e 172,26 per la 3090 Ti: un vantaggio del +8 % e del +6 %, coerente con l'8 % di banda passante in più. Le due serie provengono da contributori diversi, quindi la differenza reale dipende dalla macchina.
#Raffreddamento, limite di potenza e acquisto usato
La 3090 consuma 350 W e la Ti 450 W, con una temperatura massima della GPU rispettivamente di 93 e 92 °C secondo NVIDIA. Sotto un carico LLM prolungato, il rumore e il calore del case contano: prevedi un case ben ventilato e un alimentatore che soddisfi i requisiti di 750 W (3090) o 850 W (Ti) indicati da NVIDIA. Un LLM sollecita soprattutto la memoria: limitare la potenza comporta una perdita di velocità ridotta.
La classifica di llama.cpp fornisce un ordine di grandezza: un contributore limita la propria 3090 a 250 W e rileva 137,72 token al secondo su Llama 2 7B Q4_0, contro 158,16 nella serie con impostazioni di fabbrica. È circa il 13 % di velocità in meno per il 29 % di potenza in meno. Le due misurazioni provengono da macchine diverse: prendile come indicazione, poi misura sul tuo sistema.
L'opzione -pl di nvidia-smi imposta la potenza massima in watt. Su Windows, apri il terminale come amministratore; l'impostazione scompare al riavvio a meno che non sia automatizzata. Su una scheda usata, controlla anche la temperatura della memoria con uno strumento come HWiNFO: se sale nettamente al di sopra di quella del core, è da considerare la sostituzione dei pad termici.
#Acquistare una 3090 di seconda mano: cosa verificare
La 3090 è una scheda Ampere che si trova soprattutto di seconda mano. Per i prezzi attuali, consulta il nostro monitoraggio, che segnala il prezzo più basso di ogni scheda due volte a settimana, con il prezzo per GB di VRAM.
- Identità
- Verifica con nvidia-smi che la scheda mostri 24 GB e il modello corretto (3090 o 3090 Ti), non un altro modello.
- Stabilità
- Esegui un modello da 27 miliardi in loop per una trentina di minuti: crash, artefatti o limitazioni delle prestazioni dovute al calore sono segnali di allarme.
- Temperatura della memoria
- Confronta la temperatura della memoria con quella del core: una differenza notevole indica pad termici usurati.
- Garanzia
- Esigi la possibilità di reso o una garanzia del venditore: la sostituzione dei pad o della pasta termica è un costo da prevedere.
- Alimentazione
- 350 W o 450 W di picco: controlla l'alimentatore e i connettori di alimentazione della scheda prima dell'acquisto.
#3090, 4090, 5090: cosa si guadagna pagando di più?
Anche la RTX 4090 offre 24 GB, con una maggiore potenza di calcolo: il suo vantaggio riguarda più l'elaborazione del prompt che la generazione, che rimane limitata dalla banda passante. La RTX 5090 passa a 32 GB, una categoria in cui un modello denso da 32B conserva un margine per un contesto lungo. Le guide dedicate a queste due schede descrivono ogni caso in dettaglio.
#vLLM, due schede e fine-tuning su 3090
Tre utilizzi ricorrono spesso con la 3090. vLLM funziona: secondo la sua documentazione richiede una compute capability pari o superiore a 7.5, mentre quella della 3090 è 8.6. Per scegliere tra llama.cpp e vLLM, consulta il confronto tra i motori. Due 3090 possono essere combinate tramite un ponte NVLink per le schede della serie 30: la guida multi-GPU descrive in dettaglio la ripartizione dei layer.
Per il fine-tuning, Unsloth indica requisiti minimi di VRAM in QLoRA a 4 bit: 6 GB per un modello di 8 miliardi di parametri, 8,5 GB per 14 miliardi, 22 GB per 27 miliardi e 26 GB per 32 miliardi. La 3090 permette quindi di effettuare il fine-tuning di modelli fino a 27B in QLoRA, appena, con un batch di 1 e un contesto breve, ma non di un modello da 32B. In LoRA a 16 bit, 9 miliardi richiedono già 24 GB, cioè tutta la memoria della scheda.
- llama.cpp, vLLM, Exllama: quale motore scegliere
- LLM multi-GPU con llama.cpp: tensor-split su 2 RTX 3090
#Verdetto: in quali casi la 3090 rimane la scelta giusta
| Situazione | Decisione | Motivazione supportata da dati numerici |
|---|---|---|
| Vuoi eseguire in locale un modello denso da 27B o 32B | 3090 (o 4090) | 24 GB: da 17 a 20 GB di pesi e da 4 a 7 GB di margine |
| Punti soprattutto a modelli da 7 a 14 miliardi | Una scheda da 12 o 16 GB basta | La 3090 offre solo velocità: 936 GB/s |
| Vuoi un 70B o contesti molto lunghi | 5090 o due schede | 43 GB di pesi per un 70B Q4 |
| Il silenzio e il consumo vanno prima di tutto | Una scheda recente da 16 GB | Alimentatore da 750 W richiesto per la 3090 |
| Sei indeciso tra 3090 e 3090 Ti | Prendi la meno costosa delle due | Solo dal +6 al +8 % nella generazione |
La 3090 rimane la scelta di partenza più comune per un modello 27B in locale: è la conclusione di Hardware Corner, che la considera la migliore opzione sul mercato dell'usato per iniziare a farne un uso serio. La 4090 la sostituisce se il budget lo permette, la 5090 se vuoi 32 GB.
- Fonte: NVIDIA, specifiche RTX 3090 e 3090 Ti
- Fonte: Hardware Corner, benchmark LLM su RTX 3090
- Fonte: classifica della comunità llama.cpp su CUDA
- Fonte: documentazione di Ollama, lunghezza del contesto
- Fonte: Unsloth, VRAM richiesta per il fine-tuning
#Domande frequenti
Quale LLM eseguire su una RTX 3090?+
Una RTX 3090 può eseguire un 70B?+
RTX 3090 o 3090 Ti per un LLM locale?+
Quale alimentatore per una RTX 3090?+
La RTX 3090 supporta vLLM e Flash Attention?+
È possibile eseguire il fine-tuning di un modello su una RTX 3090?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.