Home › Catalogo › Miglior LLM su RTX 4090 (24 GB) nel 2026

Miglior LLM su RTX 4090 (24 GB) nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 09/10/2026

La RTX 4090 (24 GB di VRAM, architettura Ada Lovelace) è il punto di riferimento nel segmento consumer per l'inferenza LLM nel 2026. Ecco i modelli che la sfruttano al meglio: massima qualità in Q4/Q5 entro 24 GB, con una buona velocità di generazione (30+ token/sec).

Offerte e alternative per l'IA locale

RTX 4090 : alternativa d'acquisto disponibile per l'IA locale — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

Un mini-PC è una macchina completa: controlla la memoria necessaria e la compatibilità del software. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →

Link affiliati — QualeLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te; questo non influenza la classifica, definita in modo indipendente. In qualità di Partner Amazon, QualeLLM trae un beneficio dagli acquisti idonei.

Classifica

1

🇺🇸 Laguna XS.2

Poolside · 33 miliardi di parametri · Apache 2.0 · 131 072 token ctx

MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.

Perché questa posizione Rientra in Q5_K_M (~23 GB su 24 GB disponibili). 33B parametri, contesto di 131 072 token.
ollama run laguna-xs.2
Su RTX 4090
Q5_K_M
23 GB · 100 tok/s
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B parametri · Apache 2.0 · 128 000 token ctx

Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).

Perché questa posizione Rientra in memoria in Q5_K_M (~19 GB su 24 GB disponibili). 26B parametri, contesto di 128.000 token.
ollama run gemma4:26b
Su RTX 4090
Q5_K_M
19 GB · 60 tok/s
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B parametri · Apache 2.0 · 8 192 token ctx

Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.

Perché questa posizione Rientra in Q5_K_M (~22 GB su 24 GB disponibili). 16 miliardi di parametri, contesto di 8.192 token.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Su RTX 4090
Q5_K_M
22 GB · 130 tok/s
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Perché questa posizione Rientra nella memoria disponibile in Q5_K_M (~19 GB su 24 GB disponibili). 27B parametri, contesto di 262.144 token.
ollama run qwen3.6:27b
Su RTX 4090
Q5_K_M
19 GB · 32 tok/s
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.

Perché questa posizione Rientra nella memoria disponibile in Q5_K_M (~19 GB su 24 GB disponibili). 27B parametri, contesto di 262.144 token.
ollama run qwen3.8:27b
Su RTX 4090
Q5_K_M
19 GB · 22 tok/s
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B parametri · MIT · 128 000 token ctx

GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.

Perché questa posizione Rientra in Q5_K_M (~23 GB su 24 GB disponibili). 31B parametri, contesto di 128 000 token.
ollama run glm-4.7-flash
Su RTX 4090
Q5_K_M
23 GB · 100 tok/s
7

🇺🇸 Gemma 4 31B

Google · 31B parametri · Apache 2.0 · 256 000 token ctx

Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.

Perché questa posizione Rientra nella VRAM disponibile in Q5_K_M (~22 GB su 24 GB disponibili). 31B parametri, contesto di 256.000 token.
ollama run gemma4:31b
Su RTX 4090
Q5_K_M
22 GB · 30 tok/s

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Su RTX 4090
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 tok/s · Q5_K_M
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 60 tok/s · Q5_K_M
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 130 tok/s · Q5_K_M
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 32 tok/s · Q5_K_M
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 22 tok/s · Q5_K_M
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 tok/s · Q5_K_M
#7 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 30 tok/s · Q5_K_M
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Memo gratuito

Quale modello per la programmazione far girare sulla TUA macchina?

Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.

Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →

Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).

Metodologia della classifica

Teniamo i modelli che occupano fino a 24 GB in Q4_K_M e che utilizzano almeno il 40% della VRAM (altrimenti un 7B basta). Punti bonus per i modelli il cui utilizzo della VRAM è compreso tra il 60% e il 95% — punto ottimale qualità/velocità.

Criteri presi in considerazione:

  • Entra in 24 GB in Q4_K_M
  • Sfrutta la VRAM (> 60%)
  • Velocità ≥ 30 token/sec
  • Qualità > 7B

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

È possibile eseguire un 70B su RTX 4090?

In Q4_K_M, un 70B richiede ~40 GB di VRAM — troppo per una singola 4090. Bisogna o scendere in Q2/Q3 (perdita di qualità), o scaricare sulla RAM CPU (molto lento), o aggiungere una 2ᵉ scheda. Per un vero 70B, punta a 2× RTX 4090 o a una 5090 + DDR5.

Quale quantizzazione scegliere su RTX 4090?

Q5_K_M è il punto ottimale (perdita inferiore all'1% rispetto a FP16 secondo i benchmark). Q8 è nettamente migliore di Q5 ma consuma il 50% in più di VRAM. Q4 solo se vuoi un modello grande che non entra in Q5.

Mistral Small 3.1 24B o Qwen 2.5 32B su 4090 ?

Vedi il confronto. Mistral Small 3.1 è più veloce (24B < 32B) e migliore in francese. Qwen 2.5 32B è più capace nei compiti generali e nella programmazione.

Quale motore di inferenza su RTX 4090?

Per una chat interattiva: Ollama (semplice) o llama.cpp (massimo controllo). Per il throughput lato server: vLLM o ExLlamaV2. Il guadagno può raggiungere 2-3× su vLLM in batch.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €