Mac M4 Max e LLM locale: MLX, prestazioni, modelli
Il MacBook Pro M4 Max (64 o 128 GB di RAM unificata) è diventato il computer portatile più capace di eseguire un LLM locale. La combinazione di memoria unificata e framework MLX di Apple permette di caricare su un laptop i più grandi modelli open-weight del momento — i MoE da 30-35B a piena precisione e i modelli densi multimodali da 27B — a velocità sorprendenti. Questa guida misura ciò che funziona davvero: MLX vs Ollama, modelli concretamente utilizzabili, token/sec misurati e comportamento termico durante il funzionamento a batteria.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Mac Studio M5 Max (36 GB / 512 GB).
Perché questa scelta? La nostra scheda completa su Mac Studio M5 Max (36 GB / 512 GB) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Perché il M4 Max cambia le carte in tavola per gli LLM locali
Su un PC Windows o Linux, la VRAM della GPU è il vincolo principale. Una RTX 4090 arriva al massimo a 24 GB: eseguire in locale un modello da 30-35B in FP16 obbliga a ricorrere all'offload sulla CPU, riducendo la velocità di generazione a un quinto o a un decimo. Il M4 Max affronta il problema al contrario. La GPU e la CPU condividono la stessa memoria: tutto ciò che è nella RAM è accessibile alla GPU senza copie.
In pratica, un MacBook Pro M4 Max da 128 GB può caricare i migliori MoE del 2026 — Qwen 3.6 35B-A3B o Qwen 3.8 27B — a piena precisione FP16, oppure più modelli contemporaneamente, senza difficoltà, e continuare a eseguirli con alimentazione a batteria. Oggi nessun computer portatile x86 è in grado di farlo — serve un desktop con una RTX 5090 o due RTX 3090 per avvicinarsi allo stesso risultato, e comunque non in mobilità.
#RAM unificata: perché 128 GB ≠ 128 GB di VRAM
Hai visto i risultati di un M4 Max con MLX. Il kit Mac spiega quando MLX supera davvero GGUF (cap. 3), come calcolare il tuo budget di memoria con contesti lunghi (cap. 5) e quali prestazioni aspettarti, tenendo conto anche del calore e della batteria (cap. 6).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
macOS non permette a un singolo processo di consumare tutta la memoria. Per impostazione predefinita, la GPU può utilizzare circa il 75% della RAM totale. Su una macchina da 128 GB, questo dà circa 96 GB disponibili per i tuoi modelli. Su una da 64 GB, ottieni circa 48 GB. È ampiamente sufficiente per i modelli previsti, ma bisogna saperlo prima di fare i calcoli.
- Mac M4 Max 64 GB
- Circa 48 GB per il LLM. I migliori MoE del 2026 in Q8 trovano comodamente spazio — Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), che ci sta appena — e Mistral Small 24B ci sta persino in FP16 (≈48 GB).
- Mac M4 Max 128 GB
- Circa 96 GB per il LLM. Margine per eseguire i grandi MoE a piena precisione FP16 (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), mantenere più modelli caricati in parallelo o spingere il contesto fino a 256k token.
- Quantizzazioni raccomandate
- Q4_K_M resta una buona scelta predefinita. Con 128 GB puoi passare a Q5_K_M o Q6 senza problemi per migliorare la qualità.
#MLX vs Ollama : quale scegliere per un Mac M4 Max?
Apple ha pubblicato MLX nel dicembre 2023: un framework per il calcolo su array pensato per Apple Silicon, funzionalmente equivalente a PyTorch ma progettato intorno alla memoria unificata. Il modulo mlx-lm fornisce una CLI e un'API Python per eseguire modelli quantizzati nel formato MLX (simile al GGUF ma distinto).
- Ollama (Metal)
- Più semplice da installare, ecosistema enorme, formati GGUF universali, API compatibile con OpenAI su :11434. Leggero overhead, conversione memoria CPU↔GPU non ottimale.
- MLX (mlx-lm)
- Più veloce nella pratica su Apple Silicon: dal 20 al 40% di token/sec in più sui modelli 30B+, gestione nativa della memoria, caching dei prompt integrato. Ecosistema più piccolo, nessuna API REST standardizzata integrata di serie.
- Verdetto
- Per esplorare e provare 10 modelli: Ollama. Per sfruttare al massimo il M4 Max e far girare i grandi MoE da 30-35B a piena precisione in produzione locale: MLX.
#Installare MLX ed eseguire un primo modello
- 01Preparare un ambiente PythonUsa Python 3.10+ (3.12 consigliato). Su Mac, la soluzione più pulita è usare uv o pyenv. mlx-lm non ha prerequisiti nativi oltre ad Apple Silicon.
- 02Installare mlx-lmBasta un solo comando pip. Tutto è compilato per arm64 Metal.
- 03Avviare un modello MLXIl comando CLI mlx_lm.generate scarica il modello da Hugging Face (organizzazione mlx-community) e lo esegue.
- 04Esporre un'API HTTP (opzionale)mlx-lm include dalla versione 0.18 un comando mlx_lm.server che espone un'API compatibile con OpenAI sulla porta 8080.
#Modelli testati su MacBook Pro M4 Max 128 GB
Tutti i dati qui sotto sono misurati su un MacBook Pro 16" M4 Max (40 core GPU, 128 GB), collegato alla rete elettrica, prima a freddo e poi dopo 5 minuti di warm-up. Prompt breve (50 token), generazione di 500 token, batch 1.
- Qwen 3.6 35B-A3B Q8 (MLX)
- ≈40 GB in RAM. 42-50 token/s: il MoE attiva solo 3B di parametri, da cui l'elevata velocità di generazione nonostante le sue dimensioni. Una scelta affidabile e versatile su questo Mac.
- Qwen 3.8 27B Q8 (MLX)
- ≈30 GB in RAM. 18-22 token/s (modello denso). 262k di contesto e visione, il più vicino a un Copilot locale. Ricorda di impostare il parametro di ragionamento su low, altrimenti penserà troppo.
- Qwen3-Coder 30B-A3B Q8 (MLX)
- ≈32 GB di RAM. 44-52 token/s. MoE specializzato in codice, 256k di contesto: ideale come assistente di sviluppo locale.
- GLM 4.7 Flash Q8 (MLX)
- ≈32 GB di RAM (MoE 30B-A3B, licenza MIT). 40-48 token/s. Eccellente per agenti e chiamate a strumenti, molto reattivo.
- Granite 4.2 30B Q8 (MLX)
- ≈33 GB di RAM. 30-38 token/s. Orientato all'uso professionale/aziendale, con un consumo contenuto di token e stabile nelle sessioni lunghe.
- Mistral Small 24B FP16 (MLX)
- ≈48 GB. 18-22 token/s. Modello denso, eccellente qualità in francese, particolarmente valido nella sintesi documentale.
#Benchmark dettagliati: MLX vs Ollama vs llama.cpp
Con lo stesso modello Qwen 3.8 27B in Q8, ecco la variabilità osservata tra i tre runtime sulla stessa macchina M4 Max da 128 GB:
- MLX 8-bit (mlx-community)
- 20,5 token/s in media, prompt eval ~410 token/s
- Ollama Q8_0 (Metal)
- 15,2 token/s in media, elaborazione del prompt ~300 token/s.
- llama.cpp puro Q8_0
- 15,6 token/s in media. Ollama aggiunge poco overhead rispetto a llama.cpp.
#M4 Max vs RTX 4090: chi vince su cosa
Il confronto diretto: un MacBook Pro M4 Max da 128 GB (modello sostituito da M5 Max nel catalogo Apple — da cercare usato, prezzo variabile) contro un desktop dotato di una RTX 4090 da 24 GB usata (prezzo variabile, solo GPU, senza il resto del computer).
- Modelli piccoli ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
- La RTX 4090 vince nettamente (80-120 tok/s contro 35-60 su M4 Max). Per queste dimensioni, scegli la 4090 se hai la possibilità.
- Modelli densi 24-30B Q4 (Mistral Small, Qwen 3.8 27B)
- RTX 4090 ancora davanti (30-40 tok/s vs 18-22 su M4 Max), ma la differenza si riduce.
- Precisione piena Q8/FP16
- Il M4 Max passa in vantaggio nella pratica: esegue i migliori modelli MoE del 2026 (35B-A3B, 27B) in Q8 o FP16 nella sua RAM, mentre la RTX 4090 deve ripiegare sul Q4 o trasferire parte dell'elaborazione alla CPU (velocità ridotta a un quinto).
- MoE di grandi dimensioni (Qwen 3.6 35B-A3B)
- M4 Max eccellente grazie alla grande quantità di RAM: tutto sta in memoria, anche in FP16. La RTX 4090 deve trasferire parte del modello nella RAM di sistema appena si supera Q4.
- Mobilità
- Non c'è partita: l'M4 Max offre circa 3 ore di inferenza continua a batteria, la RTX 4090 fa 0 km.
#Gestione termica, ventole e autonomia della batteria
Il M4 Max scalda poco durante l'inferenza rispetto a una GPU NVIDIA. Sotto carico prolungato (generazione di 5 minuti con un grande MoE 35B in Q8), le ventole raggiungono circa 2.800 RPM — udibili, ma ben lontane dal rumore fastidioso di un PC da gaming. La temperatura di CPU e GPU raggiunge un massimo di circa 95 °C senza throttling significativo quando il computer è collegato alla rete elettrica.
- Collegato alla rete elettrica (caricabatteria da 140 W)
- Piena potenza, throughput massimo. Nessuna limitazione, ventole a regime moderato.
- A batteria
- macOS riduce leggermente la frequenza della GPU: circa l'80% del throughput ottenuto con l'alimentazione da rete. Qwen 3.6 35B-A3B passa da circa 45 a 37 token/s.
- Autonomia della batteria per l'inferenza
- MacBook Pro 16" M4 Max 100 Wh: ~3 h di inferenza continua su un grosso MoE 35B, ~5 h sui modelli 7B-14B, ~8 h di utilizzo misto chat + lettura.
- Rumore delle ventole
- Udibili dopo 30 secondi di generazione continua, ma molto più silenziose rispetto a un PC portatile con RTX.
#Suggerimenti per trarre il massimo dal M4 Max
- Lascia il modello caricato
- Il primo prompt dopo il caricamento è lento. Usa la modalità server (mlx_lm.server o ollama serve) per mantenere il modello in RAM per tutta la sessione.
- Preferisci il formato MLX
- I modelli pubblicati da mlx-community su Hugging Face sono ottimizzati per Apple Silicon. Cerca il prefisso "mlx-community/" prima di qualsiasi altro.
- Monitora con asitop o Stats
- asitop (equivalente di nvtop per Apple Silicon) mostra in tempo reale il consumo GPU, la memoria e la potenza istantanea.
- Modalità ad alte prestazioni
- In Impostazioni di Sistema → Batteria → scegliere « Prestazioni elevate ». Guadagno marginale ma reale sui modelli 70B.
- Disattiva Spotlight durante i test
- L'indicizzazione di Spotlight può ridurre del 5–10% la velocità di elaborazione. mdutil -a -i off la disattiva per la durata di una sessione.
#Per approfondire
Tre percorsi per approfondire il tema:
- Installare Ollama su macOS
- Se privilegi la semplicità rispetto alle prestazioni pure, la guida "Installare Ollama su macOS (Apple Silicon)" copre tutti gli strumenti Metal utilizzati da Ollama.
- Scegliere la quantizzazione
- Con 128 GB di RAM unificata, hai margine per passare a Q5_K_M, Q6 o persino FP16 — la guida "Scegliere la quantizzazione" illustra i compromessi.
- Mac Studio Ultra per andare oltre
- Se i modelli MoE da 30–35B non ti bastano e punti ai più grandi modelli open-weight (da 100B a 671B) in locale, la guida "Quale LLM su Mac Studio" copre le configurazioni Ultra fino a 512 GB.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.