🇺🇸 Gemma 4 26B-A4B MoE
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Classifica aggiornata il 09/10/2026
La RTX 3090 (24 GB GDDR6X, 936 GB/s) è il migliore rapporto prestazione/prezzo LLM nel 2026. ~600-700 € di occasione, 24 GB a piena potenza, Qwen 32B Q5 fluido. Stack 2× per 48 GB a ~1300 €.
RTX 3090 : alternativa d'acquisto disponibile per l'IA locale — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :
Un mini-PC è una macchina completa: controlla la memoria necessaria e la compatibilità del software. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link affiliati — QualeLLM può percepire una commissione sugli acquisti, senza costi aggiuntivi per te, e questo non influisce sulla classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.
ollama run gemma4:31b
Denso 30B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. Tool calling compatibile con OpenAI. Uscita 29 aprile 2026.
ollama run granite4.1:30b
MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su RTX 3090 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q5_K_M |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q5_K_M |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q5_K_M |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q5_K_M |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q5_K_M |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #8 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q5_K_M |
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilota Locale per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: Q4_K_M ≤ 22 GB. Bonus 13-32B (picco 24 GB). 936 GB/s GDDR6X = una solida scheda Ampere.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Perché la 3090 è la migliore scelta usata per gli LLM nel 2026?
24 GB di VRAM (= 4090 e 3090 Ti) a ~600-700 €. La 4070 Ti Super nuova costa ~900 € per 16 GB. La 3090 resta imbattibile nel rapporto €/GB di VRAM per i LLM. Vedi guida completa.
3090 vs 4090: quale scegliere nel 2026?
4090 circa 2× più veloce, ma circa 1500 € nuova contro circa 650 € per una 3090 usata. Se il budget lo consente, scegli la 4090. Se preferisci una scelta razionale, la 3090. Vedi RTX 4090.
Stack 2× 3090 per Llama 70B ?
Sì — 48 GB totali per circa 1300 € sul mercato dell'usato. Llama 70B Q4_K_M (~40 GB) ci sta con il parallelismo tensoriale (vLLM, llama.cpp -tp 2). ~25-35 tok/s. Difficile da battere per rapporto prezzo/prestazioni con un 70B in locale.
Quale modello offre il miglior compromesso su una 3090?
Qwen 3 32B Q5 (~22 GB) a 22-28 tok/s o Mistral Small 24B Q6 (~18 GB) a 30-35 tok/s. Per il codice, Qwen 2.5 Coder 32B Q4 (~17 GB). Vedi classifica per la programmazione.