🇺🇸 Gemma 4 26B-A4B MoE
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Classifica aggiornata il 22/09/2026
Il MacBook Pro M3 Pro / Max (18-128 GB, 300-400 GB/s) resta un eccellente laptop per l'IA locale nel 2026. Esegue senza difficoltà modelli 30B in Q4 / 70B in Q3.
Confronta i prezzi di MacBook Pro M5 Pro — 24 GB / 1 TB dai nostri rivenditori partner (schede prodotto verificate):
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
Ibrido Mamba-2 + MoE 32B/9B attivi. ~70% di RAM in meno con contesti lunghi. Apache 2.0.
ollama run granite4:small-h
MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.
ollama run qwen3:30b-a3b
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Apple M3 Max (64 GB) |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q8 |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · FP16 |
| #3 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #4 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #6 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #7 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q8 |
| #8 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q8 |
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: modelli da 3 a 100B che in Q4_K_M occupano meno di 70 GB. Bonus per i modelli da 13 a 70B (picco M3 Max) e da 7 a 32B (M3 Pro). MoE ben valutati.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
MBP M3 Pro 18 GB: abbastanza per 13B?
Sì — Mistral Nemo 12B Q4 (~7 GB) a 28-35 tok/s. Mistral Small 24B Q4 (~13 GB) entra appena in memoria e raggiunge 22-26 tok/s. Vedi il guida MBP M3.
MBP M3 Max 128 GB può eseguire Llama 70B?
Sì — Llama 3.3 70B Q4_K_M (~40 GB) raggiunge 10-14 tok/s sul M3 Max. Q5_K_M (~48 GB) rimane fluido. Era il primo laptop in pratica in grado di farlo.
M3 Max vs M4 Max?
M4 Max è ~15-20 % più veloce con la stessa RAM (Neural Engine rafforzato, memoria 546 GB/s su 16 c). M3 Max rimane eccellente: Llama 70B Q4 = 12 tok/s vs 15 tok/s su M4 Max. Non è necessario un aggiornamento.
Quale modello per il codice su MBP M3?
Qwen 2.5 Coder 32B Q4 (~17 GB) su M3 Pro 36 GB o M3 Max — ottimo per il codice Python/JS/Go. DeepSeek Coder V2 16B Q4 (~9 GB) più veloce. Vedi classifica per la programmazione.