Quale LLM su RTX 5090 (32 GB) ?
Una RTX 5090 offre 32 GB di VRAM GDDR7 e 1 792 GB/s di banda: mantiene in VRAM modelli densi da 27 a 32 miliardi di parametri (Qwen 3.5 27B, Qwen3 32B) e modelli con esperti da 30 a 35 miliardi, con un contesto lungo. Genera circa 60 token al secondo su un modello 27B denso. Un 70B (43 GB in Q4) non può essere contenuto su una sola scheda.
Con 32 GB, la RTX 5090 permette di eseguire in VRAM modelli che le schede da 24 GB non consentono di utilizzare con un contesto lungo. Questa guida presenta i modelli che entrano effettivamente in memoria, con il loro peso esatto, le velocità di generazione misurate da Hardware Corner, cosa cambia con il formato FP4, il budget per il contesto e i limiti di alimentazione. Saprai anche quando una 5090 giustifica la differenza rispetto a una 4090 o a una 3090.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 5090 per un LLM locale: ciò che permettono 32 GB
Per un LLM locale, il valore di una RTX 5090 sta nei suoi 32 GB di GDDR7 e nei suoi 1 792 GB/s di larghezza di banda: mantiene interamente in VRAM modelli da 27 a 35 miliardi di parametri con un contesto lungo, ai quali le schede da 24 GB lasciano poco margine. Secondo la libreria di Ollama, Qwen 3.5 27B pesa 17 GB, Qwen 3.8 27B 18 GB, Qwen3 32B e Gemma 4 31B 20 GB, Qwen 3.5 35B e Nemotron 3 Nano 30B 24 GB. Hardware Corner misura circa 59–61 token al secondo sui modelli densi da 27 a 32 miliardi con 4 000 token di contesto, e più di 160 su un modello a esperti da 35 miliardi. Un 70B (43 GB per Llama 3.3 in Q4) continua a non entrare su una sola scheda.
- Memoria
- 32 GB di GDDR7 su un bus da 512 bit, secondo NVIDIA; 1 792 GB/s di banda, secondo Hardware Corner.
- Calcolo
- 21 760 core CUDA e Tensor Cores di 5ª generazione, secondo NVIDIA. Capacità di calcolo 12.0, supportata da Ollama con un driver 550 o più recente.
- Consumo
- 575 W di potenza grafica e un alimentatore di sistema da 1 000 W richiesto, secondo NVIDIA, con un cavo PCIe Gen 5 da 600 W o un adattatore fornito in dotazione.
#I modelli che rientrano in 32 GB
I pesi sono quelli dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è ciò che rimane dei 32 GB prima di considerare il contesto, la cache e i buffer del motore.
| Modello | File Ollama | Margine lordo | Nota |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 18 GB | Contesto di 128k senza vincoli |
| Qwen 3.5 27B | 17 GB | 15 GB | Denso, testo e immagine |
| Qwen 3.8 27B | 18 GB | 14 GB | Denso, di generazione recente |
| Qwen3 32B / Gemma 4 31B | 20 GB | 12 GB | Limite superiore dei modelli densi utilizzabili agevolmente |
| Qwen 3.5 35B / Nemotron 3 Nano 30B | 24 GB | 8 GB | Non entrano in 24 GB con il contesto |
| Llama 3.3 70B | 43 GB | Mancano 11 GB | Non entra |
| gpt-oss 120B | 65 GB | Mancano 33 GB | Fuori portata |
I 32 GB cambiano soprattutto il margine: un modello denso da 27B lascia da 14 a 15 GB per il contesto, contro i 6–7 GB su una scheda da 24 GB, e un modello con 24 GB di pesi resta caricabile con 8 GB di margine. È questo che rende possibili i contesti da 128k quantificati più avanti.
#Velocità misurate: ciò che la 5090 offre rispetto alle altre schede
I numeri qui di seguito provengono da Hardware Corner, che effettua i test con llama.cpp su contesti da 4k a 256k. Non sono misure di QuelLLM.
| Modello (Q4_K, o MXFP4 per Qwen 3.5 35B) | Contesto 4k | Contesto 32k | Contesto 128k |
|---|---|---|---|
| Qwen3 14B | 123,8 | 82,4 | 37,2 |
| gpt-oss 20B | 298,2 | 215,1 | 112,0 |
| Qwen3 30B A3B | 226,1 | 143,1 | 76,8 |
| Qwen 3.5 27B | 58,8 | 53,8 | 44,1 |
| Gemma 4 31B | 61,1 | 55,4 | 43,4 |
| Qwen3 32B | 61,4 | 43,8 | non misurato |
| Qwen 3.5 35B (MXFP4) | 165,2 | 143,2 | 118,2 |
La generazione è limitata dalla banda passante: il limite teorico è pari a circa la banda passante divisa per il peso del modello. Per Qwen 3.5 27B (17 GB), 1 792 ÷ 17 dà 105 token al secondo e il valore misurato, 58,8, raggiunge il 56 % di questo limite. Per Qwen3 32B (20 GB), il limite è di 90 e il valore misurato è di 61,4, pari al 68 %. Un modello denso da 27 a 32 miliardi di parametri gira quindi a circa 60 token al secondo su una 5090.
Su Qwen 3.5 27B, la 5090 genera 1,76 volte più velocemente della 3090 (58,8 contro 33,5 secondo due pagine di Hardware Corner), mentre la banda passante è 1,91 volte superiore (1 792 contro 936 GB/s). Nella classifica di llama.cpp, la 5090 raggiunge circa 290–300 token al secondo su Llama 2 7B Q4_0 contro circa 160 per una 3090.
#5090 a confronto con la 4090 e la 3090: la differenza misurata
| Scheda | Memoria | Generazione relativa |
|---|---|---|
| RTX 5090 | 32 GB | 100 % |
| RTX 4090 | 24 GB | 77 % |
| RTX 3090 Ti | 24 GB | 55 % |
| RTX 3090 | 24 GB | 51 % |
#Contesto e cache KV: pianificare l'uso dei tuoi 32 GB
Ollama regola il contesto predefinito in base alla memoria video: la sua documentazione indica 32k token tra 24 e 48 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, la ricerca web e gli strumenti di programmazione. La 5090 rientra nella fascia dei 32k, più generosa dei 4k delle schede sotto i 24 GiB. Aumentare il contesto comporta un costo in termini di cache KV, che memorizza le chiavi e i valori di attenzione di ogni token letto.
La leva principale è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16, con una perdita di precisione molto bassa, e richiede Flash Attention, che Ollama attiva automaticamente quando la scheda e il modello la supportano. Regola di calcolo: la memoria disponibile dopo aver caricato il modello, meno 1–2 GB di buffer, dà il budget per la cache. Con Qwen 3.5 27B (17 GB), rimangono più di 13 GB per il contesto, come conferma la misurazione a 128k di Hardware Corner. Controlla il risultato con ollama ps.
#FP4, NVFP4, MXFP4: cosa cambia veramente Blackwell
Blackwell introduce il formato NVFP4: secondo NVIDIA, un formato a virgola mobile a 4 bit, con un fattore di scala per blocco di 16 valori contro 32 per MXFP4, quindi più fine. Hardware Corner indica che la 5090 accelera NVFP4 a livello hardware. Q4_K_M, invece, è una quantizzazione a blocchi di llama.cpp: i due non sono in contrapposizione sulla carta, sono formati di file diversi e un modello esiste nell'uno o nell'altro solo se qualcuno lo ha convertito.
In pratica, la riga Qwen 3.5 35B in MXFP4 della tabella più sopra mostra cosa si ottiene con un formato in virgola mobile a 4 bit su questa scheda: 165 token al secondo a 4k per 24 GB di pesi. Il supporto di NVFP4 negli strumenti (llama.cpp, Ollama, vLLM) evolve rapidamente: verifica la versione installata e la scheda del modello prima di scegliere un file e mantieni Q4_K_M come scelta affidabile.
#Installa Ollama su una RTX 5090
- 01Verificare il driverEsegui nvidia-smi in un terminale: il driver deve essere alla versione 550 o successiva (551.61 su Windows) e la memoria totale indicata deve essere di circa 32 GB.
- 02Installare OllamaInstalla Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
- 03Avviare un modelloEsegui ollama run qwen3.5:27b: il download di 17 GB avviene una sola volta. Per un modello mixture-of-experts più grande, prova ollama run qwen3.5:35b (24 GB).
- 04Controllare la distribuzioneIn un secondo terminale, esegui ollama ps: la colonna Processeur deve mostrare 100 % GPU.
- 05Regolare il contestoImposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se il margine non basta, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio.
#Alimentazione, calore e fine-tuning
NVIDIA dichiara 575 W di potenza grafica, un alimentatore di sistema da 1.000 W, una temperatura massima della GPU di 90 °C e un cavo PCIe Gen 5 da 600 W: la 5090 è la scheda più esigente del confronto. Controlla il cavo e il suo connettore prima dell'installazione e prevedi un case ben ventilato. Un limite di potenza riduce i consumi a fronte di una piccola perdita di velocità, poiché il LLM sollecita soprattutto la memoria (vedi la misurazione della 3090 limitata a 250 W nella guida dedicata).
Per il fine-tuning, Unsloth indica requisiti minimi di VRAM in QLoRA a 4 bit: 22 GB per un modello da 27 miliardi di parametri, 26 GB per 32 miliardi, 30 GB per 40 miliardi e 41 GB per 70 miliardi. La 5090 permette quindi di effettuare il fine-tuning di modelli fino a 40B in QLoRA, con un batch di 1 e un contesto breve, ma non di un modello da 70B.
#Verdetto: 5090, 4090 o 3090 a seconda dell'uso
| Situazione | Decisione | Motivazione supportata da dati numerici |
|---|---|---|
| Vuoi un modello denso da 27B a 32B con contesto lungo | 5090 | 32 GB: da 12 a 15 GB di margine, 44 t/s a 128k su Qwen 3.5 27B |
| Punti a un modello a esperti da 30 a 35 miliardi | 5090 | 24 GB di pesi: fuori portata per una scheda da 24 GB con il contesto |
| Resti su modelli da 8 a 14 miliardi | Nessuna 5090 | La 3090 o una scheda da 16 GB sono sufficienti |
| Hai già una 4090 | Mantenerla, salvo se servono 32 GB | Generazione al 77% di quella della 5090 |
| Vuoi un 70B | Due schede o una macchina con memoria unificata | 43 GB di pesi in Q4 |
La 5090 sostituisce una 4090 soprattutto quando la capacità non basta: il guadagno di velocità è di circa il 30% secondo Hardware Corner, mentre i 32 GB permettono di caricare modelli e contesti fuori dalla portata dei 24 GB. Per i prezzi del giorno, consulta il nostro monitoraggio, che rileva il prezzo più basso di ogni scheda due volte a settimana.
- Fonte: NVIDIA, specifiche della RTX 5090
- Fonte: Hardware Corner, benchmark LLM su RTX 5090
- Fonte: NVIDIA, presentazione del formato NVFP4
- Fonte: documentazione di Ollama, lunghezza del contesto
- Fonte: Unsloth, VRAM richiesta per il fine-tuning
#Domande frequenti
Quale LLM installare su una RTX 5090?+
Una RTX 5090 può eseguire un modello 70B?+
La RTX 5090 è molto più veloce di una 4090 per gli LLM?+
La RTX 5090 supporta FP4 e NVFP4?+
Quale alimentatore per una RTX 5090?+
È possibile fare il fine-tuning di un modello su una RTX 5090?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.