Home › Catalogo › Miglior LLM su RTX 3090 Ti (24 GB) nel 2026

Miglior LLM su RTX 3090 Ti (24 GB) nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 09/10/2026

La RTX 3090 Ti (24 GB GDDR6X, 1008 GB/s) è il top di gamma Ampere. 24 GB + 1 TB/s di banda = stesse capacità VRAM di una 4090 al 60% del prezzo nuovo, circa 700 € di seconda mano.

Offerte e alternative per l'IA locale

RTX 3090 Ti : alternativa d'acquisto disponibile per l'IA locale — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

Un mini-PC è una macchina completa: controlla la memoria necessaria e la compatibilità del software. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →

Link affiliati — QualeLLM può percepire una commissione sugli acquisti, senza costi aggiuntivi per te, e questo non influisce sulla classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

Classifica

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B parametri · Apache 2.0 · 128 000 token ctx

Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).

Perché questa posizione Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Su RTX 3090 Ti
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B parametri · Apache 2.0 · 8 192 token ctx

Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.

Perché questa posizione Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Su RTX 3090 Ti
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Perché questa posizione Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Su RTX 3090 Ti
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.

Perché questa posizione Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
Su RTX 3090 Ti
Q5_K_M
19 GB · 14 tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B parametri · MIT · 128 000 token ctx

GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.

Perché questa posizione GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
Su RTX 3090 Ti
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31B parametri · Apache 2.0 · 256 000 token ctx

Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.

Perché questa posizione Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.
ollama run gemma4:31b
Su RTX 3090 Ti
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B parametri · Apache 2.0 · 131 072 token ctx

Denso 30B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. Tool calling compatibile con OpenAI. Uscita 29 aprile 2026.

Perché questa posizione Denso 30B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. Tool calling compatibile con OpenAI. Uscita 29 aprile 2026.
ollama run granite4.1:30b
Su RTX 3090 Ti
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B parametri · NVIDIA Open Model License · 128 000 token ctx

MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.

Perché questa posizione MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
Su RTX 3090 Ti
Q5_K_M
21 GB · 30 tok/s

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Su RTX 3090 Ti
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 30 tok/s · Q5_K_M
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Memo gratuito

Quale modello per la programmazione far girare sulla TUA macchina?

Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilota Locale per farne un setup che funziona davvero.

Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →

Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).

Metodologia della classifica

Filtro: Q4_K_M ≤ 22 GB. Bonus 13-32B (picco a 24 GB) e 7-32B. Larghezza di banda di 1008 GB/s, record per Ampere.

Criteri presi in considerazione:

  • Q4_K_M ≤ 22 GB
  • Qwen 3 32B Q5 gira senza difficoltà
  • Fine-tuning LoRA 7-13B
  • 24 GB + 1 TB/s

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

RTX 3090 Ti vs 3090 ?

Gli stessi 24 GB. 3090 Ti = +7 % di core CUDA + GDDR6X 1008 GB/s contro GDDR6X 936 GB/s della 3090. Differenza ~5-8 % per gli LLM. La 3090 è spesso un affare migliore sul mercato dell'usato. Vedi RTX 3090.

3090 Ti vs 4090?

Gli stessi 24 GB. Anche la 4090 offre 1008 GB/s, più 16384 core CUDA contro i 10752 della 3090 Ti. Circa il 40-50% più veloce per gli LLM. Se acquisti nuovo, scegli la 4090. Sul mercato dell'usato, circa 700 € contro circa 1100 €: la 3090 Ti è eccellente. Vedi RTX 4090.

Llama 70B su 3090 Ti ?

Q3_K_M (~32 GB) non entra nella memoria di una sola GPU. Q2_K (~24 GB) ci entra appena, ma con una qualità inferiore. Per usare comodamente un modello da 70B, 2× 3090 Ti o RTX 5090 da 32 GB. Vedi RTX 5090.

Configurazione con 2× 3090 Ti usate?

Eccellente: 48 GB di VRAM distribuiti tra le due schede per circa 1400 € in totale. Llama 70B Q4 (~40 GB) ci sta e raggiunge circa 30 token/s tramite parallelismo tensoriale. Un rapporto qualità/prezzo difficile da battere per gli LLM nel 2026.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €