🇺🇸 Laguna XS.2
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
Classifica aggiornata il 22/09/2026
Il Mac Studio (M2 / M3 / M5 Ultra, fino a 512 GB di memoria unificata, da 800 GB/s a 1,2 TB/s) è la workstation di fascia consumer più capace per l'IA locale. 70B in Q5, 200B in Q4, modelli di frontiera da 670B in Q3.
Mac Studio : alternativa d'acquisto disponibile per l'IA locale — Mac Studio M5 Max (36 GB / 512 GB) (Altri tagli di memoria: configuratore BTO dell’Apple Store.):
Un mini-PC è una macchina completa: controlla la memoria necessaria e la compatibilità del software. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa sul Mac Studio M5 Max (36 GB / 512 GB) →
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
Ibrido Mamba-2 + MoE 32B/9B attivi. ~70% di RAM in meno con contesti lunghi. Apache 2.0.
ollama run granite4:small-h
MoE da 35B con 3B attivi, per la programmazione con agenti. 73,4% su SWE-Bench. Uscita il 16 aprile 2026.
ollama run qwen3.6:35b-a3b
MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.
ollama run qwen3:30b-a3b
MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
MoE 30B (3,3B attivi) specializzato nella programmazione agentica. Molto veloce in locale, 256k ctx nativo, il modello di riferimento per 16-24 GB tramite Ollama.
ollama run qwen3-coder:30b
MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.
ollama run qwen3-vl:30b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Apple M2 Ultra (128 GB) |
|---|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · FP16 |
| #2 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 100 tok/s · FP16 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 75 tok/s · FP16 |
| #4 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 | 60 tok/s · FP16 |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · FP16 |
| #6 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 80 tok/s · FP16 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · FP16 |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · FP16 |
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: 7-700B (sono ammessi i MoE di frontiera). Bonus elevato per 30-200B (picco Studio Ultra) e per i MoE in generale: una larghezza di banda di oltre 800 GB/s permette di sfruttare davvero questi modelli.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Mac Studio M2 Ultra 192 GB : Llama 70B fluido?
Sì — Llama 3.3 70B raggiunge circa 11 tok/s in Q5_K_M (~48 GB) e 14 tok/s in Q4 (stime: circa il 70% del limite massimo determinato dai suoi 800 GB/s). È stato il primo hardware Apple capace di far girare un 70B comodamente in locale. Vedi il guida Mac Studio.
Mac Studio Ultra 512 GB: DeepSeek 671B?
Sì — DeepSeek R1 671B (37B attivi, MoE) entra in memoria in Q4_K_M (~400 GB) su un M3 Ultra o un M5 Ultra da 512 GB, a una velocità che ne consente l'uso, poiché vengono letti solo 37B di parametri per token. Nessun altro computer desktop lo permette. Vedi DeepSeek R1 671B.
Mac Studio vs server 4× H100?
4× H100 (320 GB HBM3) costano circa 120 000 € e richiedono un'alimentazione da 2 kW. Un Mac Studio Ultra da 512 GB supera i 10 000 €, con un consumo di circa 200 W. L'H100 è circa 5–10× più veloce in termini di throughput, ma lo Studio vince per costo in €/GB di memoria e silenziosità.
MLX obbligatorio su Studio Ultra?
Consigliato. MLX sfrutta meglio la memoria unificata e va spesso più veloce di llama.cpp sui grandi modelli. Ollama (llama.cpp Metal) funziona, ma non sfrutta del tutto le capacità della macchina.