Intermedio 15 minMac

Mac M4 Max e LLM locale: MLX, prestazioni, modelli

Il MacBook Pro M4 Max (64 o 128 GB di RAM unificata) è diventato il computer portatile più capace di eseguire un LLM locale. La combinazione di memoria unificata e framework MLX di Apple permette di caricare su un laptop i più grandi modelli open-weight del momento — i MoE da 30-35B a piena precisione e i modelli densi multimodali da 27B — a velocità sorprendenti. Questa guida misura ciò che funziona davvero: MLX vs Ollama, modelli concretamente utilizzabili, token/sec misurati e comportamento termico durante il funzionamento a batteria.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Mac Studio M5 Max (36 GB / 512 GB).

Perché questa scelta? La nostra scheda completa su Mac Studio M5 Max (36 GB / 512 GB) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#Perché il M4 Max cambia le carte in tavola per gli LLM locali

Su un PC Windows o Linux, la VRAM della GPU è il vincolo principale. Una RTX 4090 arriva al massimo a 24 GB: eseguire in locale un modello da 30-35B in FP16 obbliga a ricorrere all'offload sulla CPU, riducendo la velocità di generazione a un quinto o a un decimo. Il M4 Max affronta il problema al contrario. La GPU e la CPU condividono la stessa memoria: tutto ciò che è nella RAM è accessibile alla GPU senza copie.

In pratica, un MacBook Pro M4 Max da 128 GB può caricare i migliori MoE del 2026 — Qwen 3.6 35B-A3B o Qwen 3.8 27B — a piena precisione FP16, oppure più modelli contemporaneamente, senza difficoltà, e continuare a eseguirli con alimentazione a batteria. Oggi nessun computer portatile x86 è in grado di farlo — serve un desktop con una RTX 5090 o due RTX 3090 per avvicinarsi allo stesso risultato, e comunque non in mobilità.

i
Cosa vuol dire "M4 Max"
Il M4 Max è la pianta di alto livello dei MacBook Pro 14" e 16" usciti alla fine del 2024. Esiste in due configurazioni GPU (32 o 40 core) e tre livelli di RAM: 36, 48, 64 o 128 GB. Per l'inferrimento LLM, solo le versioni da 64 e 128 GB hanno senso. La banda passante memoria annunciata è di 546 GB/s.

#RAM unificata: perché 128 GB ≠ 128 GB di VRAM

Il kit Mac

Hai visto i risultati di un M4 Max con MLX. Il kit Mac spiega quando MLX supera davvero GGUF (cap. 3), come calcolare il tuo budget di memoria con contesti lunghi (cap. 5) e quali prestazioni aspettarti, tenendo conto anche del calore e della batteria (cap. 6).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

macOS non permette a un singolo processo di consumare tutta la memoria. Per impostazione predefinita, la GPU può utilizzare circa il 75% della RAM totale. Su una macchina da 128 GB, questo dà circa 96 GB disponibili per i tuoi modelli. Su una da 64 GB, ottieni circa 48 GB. È ampiamente sufficiente per i modelli previsti, ma bisogna saperlo prima di fare i calcoli.

Mac M4 Max 64 GB
Circa 48 GB per il LLM. I migliori MoE del 2026 in Q8 trovano comodamente spazio — Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), che ci sta appena — e Mistral Small 24B ci sta persino in FP16 (≈48 GB).
Mac M4 Max 128 GB
Circa 96 GB per il LLM. Margine per eseguire i grandi MoE a piena precisione FP16 (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), mantenere più modelli caricati in parallelo o spingere il contesto fino a 256k token.
Quantizzazioni raccomandate
Q4_K_M resta una buona scelta predefinita. Con 128 GB puoi passare a Q5_K_M o Q6 senza problemi per migliorare la qualità.
Aumentare la memoria assegnata alla GPU (opzionale)
# Par défaut macOS laisse ~75% de la RAM au GPU.
# Pour pousser à ~85% (à vos risques, peut faire swapper le système) :
sudo sysctl iogpu.wired_limit_mb=110000

# Pour revenir à la valeur par défaut :
sudo sysctl iogpu.wired_limit_mb=0
!
Non spingerti oltre il 90 %
Alzare troppo il limite lascia macOS stesso senza risorse sufficienti. A partire dal 90 %, rischi blocchi del sistema e un uso continuo dello swap. Il valore predefinito è adatto al 95 % degli utilizzi.

#MLX vs Ollama : quale scegliere per un Mac M4 Max?

Apple ha pubblicato MLX nel dicembre 2023: un framework per il calcolo su array pensato per Apple Silicon, funzionalmente equivalente a PyTorch ma progettato intorno alla memoria unificata. Il modulo mlx-lm fornisce una CLI e un'API Python per eseguire modelli quantizzati nel formato MLX (simile al GGUF ma distinto).

Ollama (Metal)
Più semplice da installare, ecosistema enorme, formati GGUF universali, API compatibile con OpenAI su :11434. Leggero overhead, conversione memoria CPU↔GPU non ottimale.
MLX (mlx-lm)
Più veloce nella pratica su Apple Silicon: dal 20 al 40% di token/sec in più sui modelli 30B+, gestione nativa della memoria, caching dei prompt integrato. Ecosistema più piccolo, nessuna API REST standardizzata integrata di serie.
Verdetto
Per esplorare e provare 10 modelli: Ollama. Per sfruttare al massimo il M4 Max e far girare i grandi MoE da 30-35B a piena precisione in produzione locale: MLX.
→
I due coesistono molto bene
Molti utenti M4 Max mantengono Ollama come server permanente per le app di terze parti (Open WebUI, n8n, Continue.dev) e avviano MLX in modo occasionale per le sessioni in cui vogliono il massimo dei token/sec.

#Installare MLX ed eseguire un primo modello

  1. 01
    Preparare un ambiente Python
    Usa Python 3.10+ (3.12 consigliato). Su Mac, la soluzione più pulita è usare uv o pyenv. mlx-lm non ha prerequisiti nativi oltre ad Apple Silicon.
  2. 02
    Installare mlx-lm
    Basta un solo comando pip. Tutto è compilato per arm64 Metal.
  3. 03
    Avviare un modello MLX
    Il comando CLI mlx_lm.generate scarica il modello da Hugging Face (organizzazione mlx-community) e lo esegue.
  4. 04
    Esporre un'API HTTP (opzionale)
    mlx-lm include dalla versione 0.18 un comando mlx_lm.server che espone un'API compatibile con OpenAI sulla porta 8080.
Terminale — installazione e primo test
# 1. Environnement
python3 -m venv ~/mlx-env
source ~/mlx-env/bin/activate

# 2. Installation
pip install --upgrade mlx-lm

# 3. Téléchargement + génération en une commande
mlx_lm.generate \
  --model mlx-community/Qwen3.6-35B-A3B-Instruct-4bit \
  --prompt "Explique en français le principe de la mémoire unifiée Apple Silicon." \
  --max-tokens 512
Server MLX compatibile con OpenAI
# Démarre une API sur http://localhost:8080/v1
mlx_lm.server \
  --model mlx-community/Qwen3.8-27B-Instruct-4bit \
  --port 8080

#Modelli testati su MacBook Pro M4 Max 128 GB

Tutti i dati qui sotto sono misurati su un MacBook Pro 16" M4 Max (40 core GPU, 128 GB), collegato alla rete elettrica, prima a freddo e poi dopo 5 minuti di warm-up. Prompt breve (50 token), generazione di 500 token, batch 1.

Qwen 3.6 35B-A3B Q8 (MLX)
≈40 GB in RAM. 42-50 token/s: il MoE attiva solo 3B di parametri, da cui l'elevata velocità di generazione nonostante le sue dimensioni. Una scelta affidabile e versatile su questo Mac.
Qwen 3.8 27B Q8 (MLX)
≈30 GB in RAM. 18-22 token/s (modello denso). 262k di contesto e visione, il più vicino a un Copilot locale. Ricorda di impostare il parametro di ragionamento su low, altrimenti penserà troppo.
Qwen3-Coder 30B-A3B Q8 (MLX)
≈32 GB di RAM. 44-52 token/s. MoE specializzato in codice, 256k di contesto: ideale come assistente di sviluppo locale.
GLM 4.7 Flash Q8 (MLX)
≈32 GB di RAM (MoE 30B-A3B, licenza MIT). 40-48 token/s. Eccellente per agenti e chiamate a strumenti, molto reattivo.
Granite 4.2 30B Q8 (MLX)
≈33 GB di RAM. 30-38 token/s. Orientato all'uso professionale/aziendale, con un consumo contenuto di token e stabile nelle sessioni lunghe.
Mistral Small 24B FP16 (MLX)
≈48 GB. 18-22 token/s. Modello denso, eccellente qualità in francese, particolarmente valido nella sintesi documentale.

#Benchmark dettagliati: MLX vs Ollama vs llama.cpp

Con lo stesso modello Qwen 3.8 27B in Q8, ecco la variabilità osservata tra i tre runtime sulla stessa macchina M4 Max da 128 GB:

MLX 8-bit (mlx-community)
20,5 token/s in media, prompt eval ~410 token/s
Ollama Q8_0 (Metal)
15,2 token/s in media, elaborazione del prompt ~300 token/s.
llama.cpp puro Q8_0
15,6 token/s in media. Ollama aggiunge poco overhead rispetto a llama.cpp.
i
Perché MLX vince
MLX evita la conversione tra rappresentazioni CPU e GPU e sfrutta meglio le istruzioni Metal Performance Shaders per i matmul quantizzati. La differenza si accentua man mano che aumenta la dimensione del modello: su un 7B la differenza è marginale, sui grandi modelli 30B+ diventa evidente.

#M4 Max vs RTX 4090: chi vince su cosa

Il confronto diretto: un MacBook Pro M4 Max da 128 GB (modello sostituito da M5 Max nel catalogo Apple — da cercare usato, prezzo variabile) contro un desktop dotato di una RTX 4090 da 24 GB usata (prezzo variabile, solo GPU, senza il resto del computer).

Modelli piccoli ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
La RTX 4090 vince nettamente (80-120 tok/s contro 35-60 su M4 Max). Per queste dimensioni, scegli la 4090 se hai la possibilità.
Modelli densi 24-30B Q4 (Mistral Small, Qwen 3.8 27B)
RTX 4090 ancora davanti (30-40 tok/s vs 18-22 su M4 Max), ma la differenza si riduce.
Precisione piena Q8/FP16
Il M4 Max passa in vantaggio nella pratica: esegue i migliori modelli MoE del 2026 (35B-A3B, 27B) in Q8 o FP16 nella sua RAM, mentre la RTX 4090 deve ripiegare sul Q4 o trasferire parte dell'elaborazione alla CPU (velocità ridotta a un quinto).
MoE di grandi dimensioni (Qwen 3.6 35B-A3B)
M4 Max eccellente grazie alla grande quantità di RAM: tutto sta in memoria, anche in FP16. La RTX 4090 deve trasferire parte del modello nella RAM di sistema appena si supera Q4.
Mobilità
Non c'è partita: l'M4 Max offre circa 3 ore di inferenza continua a batteria, la RTX 4090 fa 0 km.
→
La soglia decisionale
Vuoi eseguire i migliori MoE del 2026 a piena precisione (Q8/FP16) e mantenerne diversi caricati contemporaneamente? Il M4 Max da 128 GB è il computer portatile con il miglior rapporto costo-beneficio sul mercato. Cerchi prestazioni molto elevate con un modello 13B? Una RTX 4090 per desktop costa la metà ed è due volte più veloce.

#Gestione termica, ventole e autonomia della batteria

Il M4 Max scalda poco durante l'inferenza rispetto a una GPU NVIDIA. Sotto carico prolungato (generazione di 5 minuti con un grande MoE 35B in Q8), le ventole raggiungono circa 2.800 RPM — udibili, ma ben lontane dal rumore fastidioso di un PC da gaming. La temperatura di CPU e GPU raggiunge un massimo di circa 95 °C senza throttling significativo quando il computer è collegato alla rete elettrica.

Collegato alla rete elettrica (caricabatteria da 140 W)
Piena potenza, throughput massimo. Nessuna limitazione, ventole a regime moderato.
A batteria
macOS riduce leggermente la frequenza della GPU: circa l'80% del throughput ottenuto con l'alimentazione da rete. Qwen 3.6 35B-A3B passa da circa 45 a 37 token/s.
Autonomia della batteria per l'inferenza
MacBook Pro 16" M4 Max 100 Wh: ~3 h di inferenza continua su un grosso MoE 35B, ~5 h sui modelli 7B-14B, ~8 h di utilizzo misto chat + lettura.
Rumore delle ventole
Udibili dopo 30 secondi di generazione continua, ma molto più silenziose rispetto a un PC portatile con RTX.

#Suggerimenti per trarre il massimo dal M4 Max

Lascia il modello caricato
Il primo prompt dopo il caricamento è lento. Usa la modalità server (mlx_lm.server o ollama serve) per mantenere il modello in RAM per tutta la sessione.
Preferisci il formato MLX
I modelli pubblicati da mlx-community su Hugging Face sono ottimizzati per Apple Silicon. Cerca il prefisso "mlx-community/" prima di qualsiasi altro.
Monitora con asitop o Stats
asitop (equivalente di nvtop per Apple Silicon) mostra in tempo reale il consumo GPU, la memoria e la potenza istantanea.
Modalità ad alte prestazioni
In Impostazioni di Sistema → Batteria → scegliere « Prestazioni elevate ». Guadagno marginale ma reale sui modelli 70B.
Disattiva Spotlight durante i test
L'indicizzazione di Spotlight può ridurre del 5–10% la velocità di elaborazione. mdutil -a -i off la disattiva per la durata di una sessione.
Installare asitop per monitorare la GPU
# Installation
pip install asitop

# Lancement (nécessite sudo pour lire les compteurs hardware)
sudo asitop
!
Nessun CUDA = nessun fine-tuning serio
MLX permette un fine-tuning LoRA di base, ma l'ecosistema rimane molto indietro rispetto a PyTorch + CUDA. Per un fine-tuning intensivo, un Mac M4 Max non è la macchina giusta — privilegia una RTX 3090/4090 o un servizio cloud H100.

#Per approfondire

Tre percorsi per approfondire il tema:

Installare Ollama su macOS
Se privilegi la semplicità rispetto alle prestazioni pure, la guida "Installare Ollama su macOS (Apple Silicon)" copre tutti gli strumenti Metal utilizzati da Ollama.
Scegliere la quantizzazione
Con 128 GB di RAM unificata, hai margine per passare a Q5_K_M, Q6 o persino FP16 — la guida "Scegliere la quantizzazione" illustra i compromessi.
Mac Studio Ultra per andare oltre
Se i modelli MoE da 30–35B non ti bastano e punti ai più grandi modelli open-weight (da 100B a 671B) in locale, la guida "Quale LLM su Mac Studio" copre le configurazioni Ultra fino a 512 GB.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.