🇺🇸 Gemma 4 26B-A4B MoE
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Classifica aggiornata il 22/09/2026
32 GB di memoria unificata rappresentano la fascia mainstream di qualità. Con questa memoria puoi eseguire senza difficoltà Mistral Small 24B Q4, Qwen 3 30B Q4 o Qwen 3 30B-A3B MoE in Q8.
Confronta i prezzi di Mac mini M5 Pro (24 GB / 512 GB) dai nostri rivenditori partner (schede prodotto verificate):
Perché questa scelta? La nostra scheda completa su Mac mini M5 Pro (24 GB / 512 GB) →
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.
ollama run qwen3:30b-a3b
MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
MoE 30B (3,3B attivi) specializzato nella programmazione agentica. Molto veloce in locale, 256k ctx nativo, il modello di riferimento per 16-24 GB tramite Ollama.
ollama run qwen3-coder:30b
MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.
ollama run qwen3-vl:30b
Modello MoE agentico coreano: 30B/3B attivi. Copre KR/EN/JP/ZH/TH/VI. Apache 2.0. Meccanismo di attenzione MLA.
ollama pull hf.co/kakaoai/Kanana-2-30B-GGUF
Omni MoE 30B/3B attivi. Streaming vocale. 119 lingue ASR. Apache 2.0.
ollama run qwen3-omni:30b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Apple M4 Pro (48 GB) |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q8 |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q8 |
| #3 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #4 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
| #5 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #6 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #7 | Kanana 2 30B-A3B Thinking | 30B | 18 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Qwen 3 Omni 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: modelli da 3 a 35B in cui Q4_K_M occupa meno di 22 GB (riserva 10 GB per macOS + contesto lungo). Bonus 13-30B (picco 32 GB) e MoE (Qwen 3 30B-A3B in Q8 qui).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Mac 32 GB: è possibile eseguire Mistral Small 24B in Q5?
Sì: Q5_K_M ~17 GB. A 18-25 token/sec a seconda del chip (M1 Max il più veloce, M4 base il più efficiente). Eccellente per il francese e le attività generaliste.
Qwen 3 30B-A3B (MoE) in Q4 o Q8 su 32 GB?
Q8 (~32 GB) entra appena in memoria — la usa tutta. Q4 (~17 GB) lascia più margine e libera 15 GB per il contesto + altre app. Differenza di qualità Q4 vs Q8 sui MoE: marginale (<2% nei benchmark). Preferisci Q4.
32 GB vs 48 GB: quale salto qualitativo?
48 GB permettono di eseguire i modelli densi da 32B in Q5 e quelli da 70B in Q3. Con 32 GB resti limitato ai modelli da 30B in Q4 o ai MoE 30B-A3B in Q8. Se acquisti un dispositivo nuovo, 48 GB sono meglio. Vedi Mac 48 GB.
Quale modello per il francese su un Mac con 32 GB?
Mistral Small 3.1 24B Q4 (~13 GB) o Mistral Small 3.2 24B Q4 — le migliori scelte per il francese. Magistral Small 24B per il ragionamento. Vedi classifica FR.
Approfondisci con i nostri duelli dettagliati tra i finalisti: