🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
Classifica aggiornata il 09/10/2026
64 GB di memoria unificata rappresentano, in pratica, la soglia per i modelli 70B. Llama 3.3 70B Q4_K_M sta in ~40 GB, contesto 32k incluso. È la prima soglia alla quale si può competere in locale con una configurazione multi-GPU basata su RTX 4090.
Confronta i prezzi di MacBook Pro M5 Pro — 24 GB / 1 TB dai nostri rivenditori partner (schede prodotto verificate):
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link affiliati — QualeLLM può percepire una commissione sugli acquisti, senza costi aggiuntivi per te, e questo non influisce sulla classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
Ibrido Mamba-2 + MoE 32B/9B attivi. ~70% di RAM in meno con contesti lunghi. Apache 2.0.
ollama run granite4:small-h
MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.
ollama run qwen3:30b-a3b
MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
MoE 30B (3,3B attivi) specializzato nella programmazione agentica. Molto veloce in locale, 256k ctx nativo, il modello di riferimento per 16-24 GB tramite Ollama.
ollama run qwen3-coder:30b
MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.
ollama run qwen3-vl:30b
Modello MoE agentico coreano: 30B/3B attivi. Copre KR/EN/JP/ZH/TH/VI. Apache 2.0. Meccanismo di attenzione MLA.
ollama pull hf.co/kakaoai/Kanana-2-30B-GGUF
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Apple M4 Max (64 GB) |
|---|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #2 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #4 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #5 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
| #6 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #7 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Kanana 2 30B-A3B Thinking | 30B | 18 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilota Locale per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: modelli da 7 a 100B che in Q4_K_M occupano meno di 48 GB (lasciando 16 GB a macOS + contesto). Bonus 30-70B (picco 64 GB) e MoE.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Mac 64 GB: Llama 70B Q4 fluido?
Su M3/M4 Max (400-546 GB/s), sì: 12-18 token/sec su Llama 3.3 70B Q4_K_M (~40 GB). Su M1/M2 Max (200-400 GB/s), 8-12 token/sec — utilizzabile ma più lento. Vedi MBP M4 Max.
64 GB: Llama 70B o Mistral Large 123B?
Llama 70B Q4 (~40 GB) funziona in modo fluido. Mistral Large 123B Q4 (~68 GB) non entra in 64 GB — servono almeno 96 GB. Preferisci Llama 70B o Mistral Small 3.2 24B Q8 (~26 GB) per un modello denso di qualità.
Mac 64 GB vs 2× RTX 3090 (48 GB VRAM totale) ?
2× 3090 = ~3× più veloce (936 GB/s per scheda vs 400 GB/s unificato). Ma Mac 64 GB = silenzio + portabilità + zero cavi. Per uso personale, il Mac vince in comodità. Per uso professionale in tempo reale, 2× 3090 vince in throughput.
MoE 70B su 64 GB?
Sì: Mixtral 8x7B Q4 (~28 GB) o DeepSeek V4 Flash 284B (37B attivi MoE) Q3_K_S (~140 GB) non funziona in 64 GB — serve un Mac Studio con 192+ GB. Vedi Mac Studio.