Intermedio 11 minRTX 50

Quale LLM su RTX 5090 (32 GB) ?

Risposta diretta

Una RTX 5090 offre 32 GB di VRAM GDDR7 e 1 792 GB/s di banda: mantiene in VRAM modelli densi da 27 a 32 miliardi di parametri (Qwen 3.5 27B, Qwen3 32B) e modelli con esperti da 30 a 35 miliardi, con un contesto lungo. Genera circa 60 token al secondo su un modello 27B denso. Un 70B (43 GB in Q4) non può essere contenuto su una sola scheda.

Con 32 GB, la RTX 5090 permette di eseguire in VRAM modelli che le schede da 24 GB non consentono di utilizzare con un contesto lungo. Questa guida presenta i modelli che entrano effettivamente in memoria, con il loro peso esatto, le velocità di generazione misurate da Hardware Corner, cosa cambia con il formato FP4, il budget per il contesto e i limiti di alimentazione. Saprai anche quando una 5090 giustifica la differenza rispetto a una 4090 o a una 3090.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 5090 per un LLM locale: ciò che permettono 32 GB

Per un LLM locale, il valore di una RTX 5090 sta nei suoi 32 GB di GDDR7 e nei suoi 1 792 GB/s di larghezza di banda: mantiene interamente in VRAM modelli da 27 a 35 miliardi di parametri con un contesto lungo, ai quali le schede da 24 GB lasciano poco margine. Secondo la libreria di Ollama, Qwen 3.5 27B pesa 17 GB, Qwen 3.8 27B 18 GB, Qwen3 32B e Gemma 4 31B 20 GB, Qwen 3.5 35B e Nemotron 3 Nano 30B 24 GB. Hardware Corner misura circa 59–61 token al secondo sui modelli densi da 27 a 32 miliardi con 4 000 token di contesto, e più di 160 su un modello a esperti da 35 miliardi. Un 70B (43 GB per Llama 3.3 in Q4) continua a non entrare su una sola scheda.

Memoria
32 GB di GDDR7 su un bus da 512 bit, secondo NVIDIA; 1 792 GB/s di banda, secondo Hardware Corner.
Calcolo
21 760 core CUDA e Tensor Cores di 5ª generazione, secondo NVIDIA. Capacità di calcolo 12.0, supportata da Ollama con un driver 550 o più recente.
Consumo
575 W di potenza grafica e un alimentatore di sistema da 1 000 W richiesto, secondo NVIDIA, con un cavo PCIe Gen 5 da 600 W o un adattatore fornito in dotazione.

#I modelli che rientrano in 32 GB

I pesi sono quelli dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è ciò che rimane dei 32 GB prima di considerare il contesto, la cache e i buffer del motore.

Modelli per RTX 5090 (file Ollama, Q4 salvo indicazione)
ModelloFile OllamaMargine lordoNota
gpt-oss 20B14 GB18 GBContesto di 128k senza vincoli
Qwen 3.5 27B17 GB15 GBDenso, testo e immagine
Qwen 3.8 27B18 GB14 GBDenso, di generazione recente
Qwen3 32B / Gemma 4 31B20 GB12 GBLimite superiore dei modelli densi utilizzabili agevolmente
Qwen 3.5 35B / Nemotron 3 Nano 30B24 GB8 GBNon entrano in 24 GB con il contesto
Llama 3.3 70B43 GBMancano 11 GBNon entra
gpt-oss 120B65 GBMancano 33 GBFuori portata

I 32 GB cambiano soprattutto il margine: un modello denso da 27B lascia da 14 a 15 GB per il contesto, contro i 6–7 GB su una scheda da 24 GB, e un modello con 24 GB di pesi resta caricabile con 8 GB di margine. È questo che rende possibili i contesti da 128k quantificati più avanti.

#Velocità misurate: ciò che la 5090 offre rispetto alle altre schede

I numeri qui di seguito provengono da Hardware Corner, che effettua i test con llama.cpp su contesti da 4k a 256k. Non sono misure di QuelLLM.

Generazione su RTX 5090, token al secondo (Hardware Corner)
Modello (Q4_K, o MXFP4 per Qwen 3.5 35B)Contesto 4kContesto 32kContesto 128k
Qwen3 14B123,882,437,2
gpt-oss 20B298,2215,1112,0
Qwen3 30B A3B226,1143,176,8
Qwen 3.5 27B58,853,844,1
Gemma 4 31B61,155,443,4
Qwen3 32B61,443,8non misurato
Qwen 3.5 35B (MXFP4)165,2143,2118,2

La generazione è limitata dalla banda passante: il limite teorico è pari a circa la banda passante divisa per il peso del modello. Per Qwen 3.5 27B (17 GB), 1 792 ÷ 17 dà 105 token al secondo e il valore misurato, 58,8, raggiunge il 56 % di questo limite. Per Qwen3 32B (20 GB), il limite è di 90 e il valore misurato è di 61,4, pari al 68 %. Un modello denso da 27 a 32 miliardi di parametri gira quindi a circa 60 token al secondo su una 5090.

Su Qwen 3.5 27B, la 5090 genera 1,76 volte più velocemente della 3090 (58,8 contro 33,5 secondo due pagine di Hardware Corner), mentre la banda passante è 1,91 volte superiore (1 792 contro 936 GB/s). Nella classifica di llama.cpp, la 5090 raggiunge circa 290–300 token al secondo su Llama 2 7B Q4_0 contro circa 160 per una 3090.

#5090 a confronto con la 4090 e la 3090: la differenza misurata

Generazione relativa per scheda (Hardware Corner, 5090 = 100 %)
SchedaMemoriaGenerazione relativa
RTX 509032 GB100 %
RTX 409024 GB77 %
RTX 3090 Ti24 GB55 %
RTX 309024 GB51 %
→
Il vero vantaggio: il contesto lungo
La 5090 mantiene il suo throughput quando il contesto aumenta. Qwen 3.5 27B passa da 58,8 a 44,1 token al secondo tra 4k e 128k (-25 %), e Qwen 3.5 35B in MXFP4 genera ancora 97,3 token al secondo con 256.000 token di contesto. È in questo scenario, e non in una chat breve, che i 32 GB giustificano la scelta della scheda.

#Contesto e cache KV: pianificare l'uso dei tuoi 32 GB

Ollama regola il contesto predefinito in base alla memoria video: la sua documentazione indica 32k token tra 24 e 48 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, la ricerca web e gli strumenti di programmazione. La 5090 rientra nella fascia dei 32k, più generosa dei 4k delle schede sotto i 24 GiB. Aumentare il contesto comporta un costo in termini di cache KV, che memorizza le chiavi e i valori di attenzione di ogni token letto.

La leva principale è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16, con una perdita di precisione molto bassa, e richiede Flash Attention, che Ollama attiva automaticamente quando la scheda e il modello la supportano. Regola di calcolo: la memoria disponibile dopo aver caricato il modello, meno 1–2 GB di buffer, dà il budget per la cache. Con Qwen 3.5 27B (17 GB), rimangono più di 13 GB per il contesto, come conferma la misurazione a 128k di Hardware Corner. Controlla il risultato con ollama ps.

#FP4, NVFP4, MXFP4: cosa cambia veramente Blackwell

Blackwell introduce il formato NVFP4: secondo NVIDIA, un formato a virgola mobile a 4 bit, con un fattore di scala per blocco di 16 valori contro 32 per MXFP4, quindi più fine. Hardware Corner indica che la 5090 accelera NVFP4 a livello hardware. Q4_K_M, invece, è una quantizzazione a blocchi di llama.cpp: i due non sono in contrapposizione sulla carta, sono formati di file diversi e un modello esiste nell'uno o nell'altro solo se qualcuno lo ha convertito.

In pratica, la riga Qwen 3.5 35B in MXFP4 della tabella più sopra mostra cosa si ottiene con un formato in virgola mobile a 4 bit su questa scheda: 165 token al secondo a 4k per 24 GB di pesi. Il supporto di NVFP4 negli strumenti (llama.cpp, Ollama, vLLM) evolve rapidamente: verifica la versione installata e la scheda del modello prima di scegliere un file e mantieni Q4_K_M come scelta affidabile.

#Installa Ollama su una RTX 5090

  1. 01
    Verificare il driver
    Esegui nvidia-smi in un terminale: il driver deve essere alla versione 550 o successiva (551.61 su Windows) e la memoria totale indicata deve essere di circa 32 GB.
  2. 02
    Installare Ollama
    Installa Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
  3. 03
    Avviare un modello
    Esegui ollama run qwen3.5:27b: il download di 17 GB avviene una sola volta. Per un modello mixture-of-experts più grande, prova ollama run qwen3.5:35b (24 GB).
  4. 04
    Controllare la distribuzione
    In un secondo terminale, esegui ollama ps: la colonna Processeur deve mostrare 100 % GPU.
  5. 05
    Regolare il contesto
    Imposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se il margine non basta, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio.
Comandi di base
ollama run qwen3.5:27b
ollama run qwen3.5:35b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Alimentazione, calore e fine-tuning

NVIDIA dichiara 575 W di potenza grafica, un alimentatore di sistema da 1.000 W, una temperatura massima della GPU di 90 °C e un cavo PCIe Gen 5 da 600 W: la 5090 è la scheda più esigente del confronto. Controlla il cavo e il suo connettore prima dell'installazione e prevedi un case ben ventilato. Un limite di potenza riduce i consumi a fronte di una piccola perdita di velocità, poiché il LLM sollecita soprattutto la memoria (vedi la misurazione della 3090 limitata a 250 W nella guida dedicata).

Per il fine-tuning, Unsloth indica requisiti minimi di VRAM in QLoRA a 4 bit: 22 GB per un modello da 27 miliardi di parametri, 26 GB per 32 miliardi, 30 GB per 40 miliardi e 41 GB per 70 miliardi. La 5090 permette quindi di effettuare il fine-tuning di modelli fino a 40B in QLoRA, con un batch di 1 e un contesto breve, ma non di un modello da 70B.

#Verdetto: 5090, 4090 o 3090 a seconda dell'uso

Quale scelta fare in base alla tua situazione
SituazioneDecisioneMotivazione supportata da dati numerici
Vuoi un modello denso da 27B a 32B con contesto lungo509032 GB: da 12 a 15 GB di margine, 44 t/s a 128k su Qwen 3.5 27B
Punti a un modello a esperti da 30 a 35 miliardi509024 GB di pesi: fuori portata per una scheda da 24 GB con il contesto
Resti su modelli da 8 a 14 miliardiNessuna 5090La 3090 o una scheda da 16 GB sono sufficienti
Hai già una 4090Mantenerla, salvo se servono 32 GBGenerazione al 77% di quella della 5090
Vuoi un 70BDue schede o una macchina con memoria unificata43 GB di pesi in Q4

La 5090 sostituisce una 4090 soprattutto quando la capacità non basta: il guadagno di velocità è di circa il 30% secondo Hardware Corner, mentre i 32 GB permettono di caricare modelli e contesti fuori dalla portata dei 24 GB. Per i prezzi del giorno, consulta il nostro monitoraggio, che rileva il prezzo più basso di ogni scheda due volte a settimana.

#Domande frequenti

FAQ
Quale LLM installare su una RTX 5090?+
Inizia con Qwen 3.5 27B: il suo file Ollama da 17 GB lascia circa 15 GB di margine e genera intorno a 59 token al secondo secondo Hardware Corner. Per un modello a esperti più grande, Qwen 3.5 35B (24 GB) supera i 160 token al secondo. Qwen3 32B e Gemma 4 31B (20 GB) rappresentano il limite superiore dei modelli densi.
Una RTX 5090 può eseguire un modello 70B?+
No, non interamente. Llama 3.3 70B occupa 43 GB in Ollama, cioè 11 GB in più della capacità della scheda, e gpt-oss 120B ne occupa 65. Quando il modello viene distribuito tra VRAM e RAM, la velocità di generazione cala, perché ogni token rilegge tutti i pesi di un modello denso. Per tenere un 70B in VRAM, servono due schede o una macchina con memoria unificata.
La RTX 5090 è molto più veloce di una 4090 per gli LLM?+
Secondo Hardware Corner, la 4090 genera il 77% del throughput della 5090, cioè una differenza del 30% circa a favore della 5090. Il suo vantaggio principale rimane i 32 GB di memoria, che permettono di caricare modelli e contesti più grandi.
La RTX 5090 supporta FP4 e NVFP4?+
Sì: NVFP4 è un formato a 4 bit introdotto con Blackwell e Hardware Corner indica che la scheda lo accelera tramite hardware. Il supporto software è in evoluzione: verifica che la tua versione di Ollama, llama.cpp o vLLM supporti il formato del modello. Q4_K_M rimane una scelta affidabile, senza necessità di FP4.
Quale alimentatore per una RTX 5090?+
NVIDIA indica un alimentatore di sistema da 1.000 W per una potenza grafica di 575 W, con un cavo PCIe Gen 5 da 600 W o l'adattatore fornito. Hardware Corner consiglia almeno un alimentatore da 950 W Gold. Scegli un alimentatore di qualità e verifica il cavo prima dell'installazione.
È possibile fare il fine-tuning di un modello su una RTX 5090?+
Sì, in QLoRA. Secondo Unsloth, il minimo è di 22 GB per un modello da 27B e di 30 GB per un modello da 40B, che entra nei 32 GB con un batch di 1. Un modello da 70B richiede 41 GB e non entra. Sono minimi assoluti: il contesto e il batch li aumentano.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.