Quale LLM su RTX 4090 (24 GB) ?
La RTX 4090 (ottobre 2022) resta nel 2026 il punto di riferimento per l'IA locale su hardware consumer: 24 GB di VRAM GDDR6X, 1008 GB/s di larghezza di banda, 16 384 core CUDA Ada Lovelace. Fa girare Qwen 3.5 9B a oltre 90 tok/s, un Qwen 3.8 27B Q4 senza difficoltà e persino un Llama 70B Q4 con un leggero offload. Ora disponibile a 1700-2000 € sul mercato dell'usato (scorte ex-LHR), offre un rapporto prestazioni/€ migliore di una 5080 nuova per un uso esclusivamente LLM. Questa guida descrive in dettaglio tutti i modelli che girano e gli ordini di grandezza del throughput.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La RTX 4090 nel 2026, ancora regina
- Architettura
- Ada Lovelace (AD102), processo produttivo TSMC 4N. 76 miliardi di transistor.
- VRAM
- 24 GB GDDR6X a 21 Gbps, bus da 384 bit. Larghezza di banda di 1008 GB/s.
- Core CUDA
- 16 384. Tensor Core di 4ª generazione con FP8 nativo. RT Core di 3ª generazione.
- TDP
- 450 W. Alimentatore da 850 W consigliato.
- Prezzo 2026
- 1700-2000 € per un esemplare usato in buone condizioni.
#1. Modelli compatibili con 24 GB
| Modello | Quant | VRAM | Tokens/sec | Uso |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 GB | 117-143 | Chat istantanea |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 36-44 | Chat + RAG FR |
| Qwen 3.6 27B | Q4_K_M | 16 GB | 29-35 | Assistente professionale per la programmazione |
| Qwen 3.8 27B | Q4_K_M | 16 GB | 20-24 | Ragionamento di qualità |
| Mistral Small 24B | Q6_K | 20 GB | 32-38 | Punto ottimale versatile |
| GLM 4.7 Flash | Q4_K_M | 19 GB | 90-110 | Ragionamento avanzato |
| Granite 4.1 30B Instruct | Q4_K_M | 17 GB | 27-33 | Codice complesso multi-file |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 GB | 54-66 | Offload di 2 GB nella RAM di sistema, utilizzabile |
| Gemma 4 31B | Q5_K_M | 22 GB | 27-33 | Tutto in VRAM, qualità degradata |
#2. Installazione & CUDA
- 01Driver NVIDIA 550+CUDA 12.4+. Per una 4090 nuova, GeForce Experience fa il necessario. Linux: nvidia-driver-565 o successivo.
- 02OllamaProgramma di installazione standard da ollama.com. Rilevamento automatico della GPU CUDA.
- 03Primo test di un modello con 24 GB di VRAMollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. Benchmark token/sec
| Modello | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Ottimizzazioni Ada
- Flash Attention 2
- Attivo per impostazione predefinita. FA3 arriverà nelle future versioni di llama.cpp
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Permette un contesto di 32k su un modello 14B in circa 15 GB, lasciando 9 GB per altri processi.
- Limite di potenza
- nvidia-smi -pl 350 (a partire da 350 W). LLM: -2% di velocità, -25% di calore e rumore. Configurazione sostenibile 24/7.
- FP8 tramite TensorRT-LLM
- Ada supporta il FP8 nativo. Attraverso TensorRT-LLM, +40 % di throughput batch su Qwen 3.5 9B. Soprattutto utile nel serving multiutente.
#5. 4090 vs 5090 vs 3090
| Criterio | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | 24 GB GDDR6X |
| Larghezza di banda | 1792 GB/s | 1008 GB/s | 936 GB/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| Prezzo 2026 | ≈ 5 700 € (28/09/2026) | ~1800 € usata | ~750 € usato |
#Usato nel 2026: acquisto intelligente?
- Compra una 4090 usata se
- Budget 1500-2000 €, uso intensivo di LLM, nessuna necessità dell'ultimissima generazione. 24 GB di VRAM = un enorme punto di forza.
- Preferisci una RTX 5090 se
- Budget ≥ 5 700 €, utilizzo regolare di modelli 70B, necessità di FP4 nativo, server per il team. 32 GB cambiano la situazione.
- Preferisci una RTX 3090 se
- Budget ≤ 1000 €, uso esclusivo di LLM, velocità secondaria. Stessa VRAM a metà prezzo.
- Preferisci una RTX 5070 Ti se
- Budget ~1 400 €, uso massimo 14B. Nuovo con garanzia, GDDR7, supporto FP4.
#Domande frequenti
La RTX 4090 può eseguire localmente Llama 3.3 70B?+
Quanti token/sec per Qwen 3.5 9B su RTX 4090?+
RTX 4090 usata o RTX 5080 nuova?+
La RTX 4090 scalda e consuma molto quando esegue LLM?+
È possibile fare fine-tuning LoRA su RTX 4090?+
La RTX 4090 supporta FP8?+
Quale alimentatore per la RTX 4090?+
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.