🇺🇸 Laguna XS.2
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
Classifica aggiornata il 09/10/2026
96 GB di memoria unificata (M2/M3/M4 Max al massimo, Studio M2 di base) offrono un ampio margine: Llama 70B in Q5/Q6, modelli 100B in Q4, contesto 100k+ per RAG su testi lunghi.
Confronta i prezzi di MacBook Pro M5 Pro — 24 GB / 1 TB dai nostri rivenditori partner (schede prodotto verificate):
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link affiliati — QualeLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te; questo non influenza la classifica, definita in modo indipendente. In qualità di Partner Amazon, QualeLLM trae un beneficio dagli acquisti idonei.
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
Ibrido Mamba-2 + MoE 32B/9B attivi. ~70% di RAM in meno con contesti lunghi. Apache 2.0.
ollama run granite4:small-h
MoE da 35B con 3B attivi, per la programmazione con agenti. 73,4% su SWE-Bench. Uscita il 16 aprile 2026.
ollama run qwen3.6:35b-a3b
MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.
ollama run qwen3:30b-a3b
MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
MoE 30B (3,3B attivi) specializzato nella programmazione agentica. Molto veloce in locale, 256k ctx nativo, il modello di riferimento per 16-24 GB tramite Ollama.
ollama run qwen3-coder:30b
MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.
ollama run qwen3-vl:30b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Apple M3 Max (64 GB) |
|---|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #2 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #4 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 | 22 tok/s · Q8 |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #6 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: modelli da 13 a 150B con Q4_K_M che occupano meno di 72 GB (riserva 24 GB a macOS + contesto lungo). Bonus 30-100B (picco 96 GB) e MoE (fino a 150B accessibile).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Mac 96 GB: Llama 70B Q5 o Mistral Large 123B Q4?
Llama 70B Q5_K_M (~48 GB) + contesto 32k = ~58 GB utilizzati, 38 GB liberi. Mistral Large 123B Q4_K_M (~68 GB) ci sta appena, 28 GB liberi. Llama 70B Q5 è più comodo da usare, Mistral Large offre maggiori capacità. Dipende dall'uso.
MacBook Pro M3 Max 96 GB nel 2026: ancora rilevante?
Sì — è il punto ottimale prezzo/performance per workstation portatili. ~3500 € di occasione, banda passante 400 GB/s, Llama 70B fluido. Il M4 Max 128 GB è ~25 % più veloce ma 2 volte più costoso. Vedi MBP M3.
Contesto 100k+ su Mac 96 GB ?
Sì: Qwen 3 32B Q5 (~22 GB) + cache KV 100k (~25 GB) = ~47 GB, con un ampio margine. Per Llama 70B + 100k ctx (~16 GB di cache KV), solo la versione Q4_K_M (~40 GB) entra in memoria — in totale ~56 GB, ancora con un buon margine.
96 GB vs 128 GB: cosa cambia?
128 GB permettono di usare modelli MoE da 130-150B (Granite 4 Mamba) in Q6 e Llama 70B Q8 (~75 GB). Con 96 GB si resta limitati a Q5/Q6 sui modelli da 70B. Per la workstation definitiva, 128 GB o Studio Ultra. Vedi Mac 128 GB.