Intermedio 12 minRTX 40

Quale LLM su RTX 4090 (24 GB) ?

La RTX 4090 (ottobre 2022) resta nel 2026 il punto di riferimento per l'IA locale su hardware consumer: 24 GB di VRAM GDDR6X, 1008 GB/s di larghezza di banda, 16 384 core CUDA Ada Lovelace. Fa girare Qwen 3.5 9B a oltre 90 tok/s, un Qwen 3.8 27B Q4 senza difficoltà e persino un Llama 70B Q4 con un leggero offload. Ora disponibile a 1700-2000 € sul mercato dell'usato (scorte ex-LHR), offre un rapporto prestazioni/€ migliore di una 5080 nuova per un uso esclusivamente LLM. Questa guida descrive in dettaglio tutti i modelli che girano e gli ordini di grandezza del throughput.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#La RTX 4090 nel 2026, ancora regina

Architettura
Ada Lovelace (AD102), processo produttivo TSMC 4N. 76 miliardi di transistor.
VRAM
24 GB GDDR6X a 21 Gbps, bus da 384 bit. Larghezza di banda di 1008 GB/s.
Core CUDA
16 384. Tensor Core di 4ª generazione con FP8 nativo. RT Core di 3ª generazione.
TDP
450 W. Alimentatore da 850 W consigliato.
Prezzo 2026
1700-2000 € per un esemplare usato in buone condizioni.
→
Perché è ancora rilevante nel 2026
24 GB = la soglia magica che permette di eseguire Llama 3.3 70B Q2_K (26 GB con 2 GB in offload), Qwen 3.8 27B in Q8 e Qwen3-Coder 30B-A3B. La 5080 (nuova, 16 GB) non ci riesce; la 5090 (nuova, 32 GB, ≈ 5 700 €) costa circa 3× tanto. In termini di puro rapporto VRAM/€, la 4090 usata domina.

#1. Modelli compatibili con 24 GB

Modelli LLM — RTX 4090 24 GB
ModelloQuantVRAMTokens/secUso
gpt-oss 20BQ4_K_M13 GB117-143Chat istantanea
Devstral Small 2 24BQ4_K_M14 GB36-44Chat + RAG FR
Qwen 3.6 27BQ4_K_M16 GB29-35Assistente professionale per la programmazione
Qwen 3.8 27BQ4_K_M16 GB20-24Ragionamento di qualità
Mistral Small 24BQ6_K20 GB32-38Punto ottimale versatile
GLM 4.7 FlashQ4_K_M19 GB90-110Ragionamento avanzato
Granite 4.1 30B InstructQ4_K_M17 GB27-33Codice complesso multi-file
Gemma 4 26B-A4B MoEQ5_K_M19 GB54-66Offload di 2 GB nella RAM di sistema, utilizzabile
Gemma 4 31BQ5_K_M22 GB27-33Tutto in VRAM, qualità degradata
i
Llama 70B: quale quantizzazione preferire?
Q4_K_M (42 GB): richiede un offload massiccio, circa 6 tok/s, ed è poco confortevole. Q2_K (26 GB): 2 GB da trasferire alla RAM, circa 10 tok/s, con qualità discreta. IQ2_XS (21 GB): tutto in VRAM, circa 20 tok/s, ma con qualità nettamente peggiore. Per usare comodamente in locale un modello da 70B, scegli una 5090 (32 GB) o un Mac Studio.

#2. Installazione & CUDA

  1. 01
    Driver NVIDIA 550+
    CUDA 12.4+. Per una 4090 nuova, GeForce Experience fa il necessario. Linux: nvidia-driver-565 o successivo.
  2. 02
    Ollama
    Programma di installazione standard da ollama.com. Rilevamento automatico della GPU CUDA.
  3. 03
    Primo test di un modello con 24 GB di VRAM
    ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
Configurazione completa su Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.8:27b

#3. Benchmark token/sec

RTX 4090 24 GB — ordini di grandezza in token/s
ModelloQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B135 t/s122 t/s110 t/s90 t/s
Granite 4.2 8B100 t/s92 t/s82 t/s66 t/s
Qwen 3.5 9B92 t/s85 t/s76 t/s62 t/s
Gemma 4 12B70 t/s64 t/s57 t/s48 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 3.8 27B32 t/s28 t/s25 t/s—

#4. Ottimizzazioni Ada

Flash Attention 2
Attivo per impostazione predefinita. FA3 arriverà nelle future versioni di llama.cpp
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permette un contesto di 32k su un modello 14B in circa 15 GB, lasciando 9 GB per altri processi.
Limite di potenza
nvidia-smi -pl 350 (a partire da 350 W). LLM: -2% di velocità, -25% di calore e rumore. Configurazione sostenibile 24/7.
FP8 tramite TensorRT-LLM
Ada supporta il FP8 nativo. Attraverso TensorRT-LLM, +40 % di throughput batch su Qwen 3.5 9B. Soprattutto utile nel serving multiutente.

#5. 4090 vs 5090 vs 3090

I tre modelli di punta NVIDIA per il mercato consumer
CriterioRTX 5090RTX 4090RTX 3090
VRAM32 GB GDDR724 GB GDDR6X24 GB GDDR6X
Larghezza di banda1792 GB/s1008 GB/s936 GB/s
Qwen 3.5 9B Q4115 t/s92 t/s66 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
Prezzo 2026≈ 5 700 € (28/09/2026)~1800 € usata~750 € usato
→
Il miglior rapporto 24 GB/€: 3090 usata
A 750 € contro 1800 €, la 3090 offre gli stessi 24 GB di VRAM. Perdita di circa il 30 % in velocità pura. Se la tua priorità è la VRAM (modelli da 24–32B, QLoRA 14B+) e non la velocità massima, la 3090 usata rimane la scheda con il miglior rapporto qualità/prezzo per gli LLM di tutta la storia NVIDIA.

#Usato nel 2026: acquisto intelligente?

Compra una 4090 usata se
Budget 1500-2000 €, uso intensivo di LLM, nessuna necessità dell'ultimissima generazione. 24 GB di VRAM = un enorme punto di forza.
Preferisci una RTX 5090 se
Budget ≥ 5 700 €, utilizzo regolare di modelli 70B, necessità di FP4 nativo, server per il team. 32 GB cambiano la situazione.
Preferisci una RTX 3090 se
Budget ≤ 1000 €, uso esclusivo di LLM, velocità secondaria. Stessa VRAM a metà prezzo.
Preferisci una RTX 5070 Ti se
Budget ~1 400 €, uso massimo 14B. Nuovo con garanzia, GDDR7, supporto FP4.

#Domande frequenti

La RTX 4090 può eseguire localmente Llama 3.3 70B?+
Sì, ma con compromessi. Q4_K_M (42 GB): offload massiccio → 6-8 tok/s (inutilizzabile). Q2_K (26 GB): 2 GB in RAM → 10-12 tok/s (accettabile). IQ2_XS (21 GB): tutto in VRAM → 20 tok/s, ma con qualità ridotta. Per usare comodamente un modello davvero grande, preferisci una 5090 (32 GB), oppure resta su un Qwen 3.8 27B che rientra interamente nella VRAM.
Quanti token/sec per Qwen 3.5 9B su RTX 4090?+
Circa 90 token al secondo in Q4_K_M, 62 token/s in Q8_0. Più che sufficiente per qualsiasi uso in chat, con in più i 256k di contesto e le capacità visive del modello.
RTX 4090 usata o RTX 5080 nuova?+
4090 usata (1800 €): 24 GB di VRAM, 10% più lenta di una 5080 su 7B ma permette di eseguire 70B in offload e 32B in Q6. 5080 nuova (≈ da 1 500 a 1 850 €): 16 GB, più veloce sui modelli piccoli, garanzia di 3 anni, supporto FP4. Per il solo uso con LLM, la 4090 vince grazie alla VRAM. Per prestazioni + garanzia, la 5080.
La RTX 4090 scalda e consuma molto quando esegue LLM?+
Meno che durante il gioco. Inferenza continuativa con Qwen 3.5 9B: 250-320 W (contro un TDP di 450 W), GPU a 65-72 °C. Basta un case con un flusso d'aria adeguato. Per un uso 24/7, effettuare l'undervolting a 350 W riduce calore e rumore senza una perdita significativa di prestazioni con gli LLM.
È possibile fare fine-tuning LoRA su RTX 4090?+
Sì, è ottima. LoRA su Qwen 3.5 9B: 12 GB, con un buon margine usando batch 4 e contesto 4096. QLoRA su Mistral Small 24B: ~18 GB, possibile. QLoRA su un 70B: il margine è ridotto, ma è fattibile con unsloth + batch 1. Per un LoRA classico su 70B, servono 2× 4090 o una 5090.
La RTX 4090 supporta FP8?+
Sì, i Tensor Cores di 4ª gen Ada Lovelace supportano nativamente FP8. Sfruttato da TensorRT-LLM (guadagno +30-40 % vs FP16), vLLM (0.5+), parzialmente da llama.cpp. Per Ollama consumer, restano Q4-Q8. Per serving batch, FP8 vale la pena.
Quale alimentatore per la RTX 4090?+
Un alimentatore di qualità da almeno 850 W (ATX 3.0 consigliato ma non obbligatorio). Nell'uso con LLM, consumo medio di 250-320 W. Nei giochi o nei benchmark, 450 W. Con una CPU di fascia alta (9950X, 14900K), 1000 W offrono più margine.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.