Intermedio 12 minMacBook Pro

Quale LLM su MacBook Pro M3 Pro / Max (18–128 GB) ?

Il MacBook Pro M3 Pro / Max (fine 2023) è nel 2026 il punto di equilibrio ideale tra i laptop per gli LLM locali. L'M3 Max a 16 core offre 400 GB/s di larghezza di banda e fino a 128 GB di memoria unificata — abbastanza per eseguire tutto il catalogo open-weight del 2026 a piena precisione: Qwen 3.6 35B-A3B in Q8, Qwen 3.8 27B in versione densa, oppure più modelli caricati in parallelo con contesti di 128k e oltre. Attenzione: l'M3 Pro ha subito una riduzione della larghezza di banda della memoria (150 GB/s, contro i 200 dell'M2 Pro). Questa guida chiarisce cosa permette davvero ciascuna variante.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#MBP M3 Pro / Max nel 2026

Data di uscita
Ottobre-novembre 2023. Ancora supportato da macOS Sequoia e dalle versioni successive.
M3 Pro
11 o 12 nuclei CPU + 14 o 18 nuclei GPU, 150 GB/s (riduzione rispetto al M2 Pro), RAM 18 o 36 GB
M3 Max 14-core
14 core CPU + 30 core GPU, 300 GB/s, RAM 36 o 96 GB.
M3 Max 16-core
16 core CPU + 40 core GPU, 400 GB/s, RAM 48, 64 o 128 GB.
!
La trappola del M3 Pro
Apple ha ridotto la banda passante della memoria del M3 Pro (150 GB/s contro 200 per M2 Pro). Risultato: il M3 Pro è più lento del M2 Pro con gli LLM. Se cerchi un M3, punta direttamente al M3 Max — oppure tieni un M2 Pro di seconda mano.

#1. M3 Pro vs M3 Max (attenzione alla trappola)

M3 Pro 150 GB/s
Adeguato per i modelli da 9B-12B (~30 tok/s), ma fatica con i modelli densi da 24B+ (~12 tok/s). Evitalo se punti a modelli densi da 24B+.
M3 Max 14-core 300 GB/s
Un buon compromesso: Qwen 3.6 35B-A3B (MoE) a 35-38 tok/s, Qwen 3.8 27B denso a 15-17 tok/s. RAM massima: 96 GB.
M3 Max 16-core 400 GB/s
La fascia alta. +30 % di velocità sui modelli di grandi dimensioni, con la possibilità di avere 128 GB di RAM per la piena precisione Q8 e più modelli in parallelo.

#2. Da 18 a 128 GB: quali LLM

Modelli compatibili per configurazione MBP M3
ModelloQuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Qwen 3.5 9BQ5_K_M✓ 30✓ 32✓ 46✓ 48✓ 50
Gemma 4 12BQ5_K_M✓ 14✓ 16✓ 26✓ 28✓ 30
Mistral Small 24BQ5_K_M—✓ 10✓ 17✓ 19✓ 20
Qwen 3.8 27BQ5_K_M——✓ 15✓ 16✓ 17
Qwen 3.6 35B-A3BQ5_K_M——✓ 38✓ 40✓ 42
Qwen 3.6 35B-A3BQ8_0——✓ 32✓ 34✓ 36
Qwen3-Coder 30B-A3BQ8_0——✓ 33✓ 35✓ 37
GLM 4.7 FlashQ4_K_M——✓ 44✓ 46✓ 48

#3. Benchmark token/sec

Ordini di grandezza — MBP M3 Max con GPU a 16 core, 128 GB, Ollama, alimentato dalla rete elettrica
ModelloQ4_K_MQ5_K_MFlash Attn 8k
Qwen 3.5 9B54 t/s50 t/s48 t/s
Gemma 4 12B34 t/s30 t/s29 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 3.8 27B19 t/s17 t/s16 t/s
Qwen 3.6 35B-A3B46 t/s42 t/s40 t/s

#4. Installazione e configurazione

Setup completo MBP M3 Max 128 GB
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull qwen3.6:35b

#5. Grandi modelli a piena precisione con Flash Attention

Flash Attention, a lungo riservato a CUDA, è ora disponibile su Metal da fine 2024 attraverso llama.cpp e Ollama. Grande vantaggio sui contesti lunghi — indispensabile per spingere un Qwen 3.6 35B-A3B a 128k di contesto.

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
llama.cpp compilato in proprio — Qwen 3.6 35B contesto 16k
./build/bin/llama-cli \
  -m ./models/qwen3.6-35b-a3b-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
→
Miglioramenti misurati con Flash Attention su M3 Max
Contesto 4k: +8 %. Contesto 8k: +15 %. Contesto 16k: +25 %. Più è ampio il contesto, più è evidente il guadagno. Da attivare sistematicamente su M3 Max.

#6. Il M3 Max da 128 GB: siamo nel territorio delle workstation

Qwen 3.6 35B-A3B Q8
Piena precisione, qualità massima. ~36 token/s (MoE, 3B attivi). La versione da 128 GB permette di usare Q8 senza compromessi sul contesto.
Qwen 3.8 27B Q8
Il più grande modello generalista denso a piena precisione (~29 GB). ~15 tok/s. Il modello «vicino a Copilot» del 2026, con capacità visive incluse.
2 modelli 30B in parallelo
Un Qwen 3.6 35B-A3B + un Qwen3-Coder 30B-A3B caricati contemporaneamente. ~42 GB totali. Per agenti con più specializzazioni.
Contesto 128k+ su 35B
Con la cache KV Q8, Qwen 3.6 35B-A3B + contesto 128k rientra in circa 50 GB. Analisi approfondita di documenti lunghi.

#M3 Max vs M4 Max

Larghezza di banda
M3 Max 16-core = 400 GB/s. M4 Max 16-core = 546 GB/s (+36 %).
Velocità Qwen 3.6 35B-A3B
M3 Max ~40 tok/s, M4 Max ~54 tok/s. +35 % in uso reale.
RAM massima
Identico: 128 GB nelle due configurazioni top.
Verdetto
M4 Max se acquisti nuovo. Anche un M3 Max usato a un prezzo inferiore del 25% è un ottimo affare.

#Domande frequenti

Il M3 Pro è veramente più lento del M2 Pro per gli LLM?+
Sì, per i modelli densi da 24B in su, a causa della larghezza di banda (150 GB/s contro 200). Su Qwen 3.5 9B, la differenza è piccola (~5%). Su Mistral Small 24B, il M2 Pro è più veloce del 10-15%. Consiglio: se acquisti usato e punti a modelli densi da 24B in su, preferisci il M2 Pro o passa direttamente al M3 Max.
Quale MBP M3 usare per eseguire grandi modelli nel 2026?+
M3 Max 14-core 64 GB per un Qwen 3.6 35B-A3B in Q8 (~35 tok/s, MoE), M3 Max 16-core 96-128 GB per caricare diversi modelli o estendere il contesto a 128k. Il M3 Pro 36 GB si limita al 24B denso.
Differenza tra M3 Max 14-core e 16-core in pratica?+
+30 % di banda (300 vs 400 GB/s), +33 % di core GPU, opzione 128 GB RAM. Su un grosso MoE 35B: +40 % di velocità. Su un 9B: +8 % soltanto. Se cerchi modelli grandi, il 16-core è un vero investimento.
128 GB di RAM sono davvero utili nel 2026?+
Sì, se vuoi: Qwen 3.6 35B-A3B in Q8 (precisione piena, qualità migliore di un Q4), due modelli da 30B in parallelo o un contesto di 128k. Per un uso standard, 64 GB sono ampiamente sufficienti.
Flash Attention cambia davvero qualcosa sul M3 Max?+
Sì, dal 15 al 25% di velocità in più con contesti da 8k a 16k, senza perdita di qualità. Da attivare per impostazione predefinita tramite OLLAMA_FLASH_ATTENTION=1.
Autonomia della batteria durante una chat con un modello di grandi dimensioni?+
Circa 1 ora e 40 minuti di chat continua sul modello da 16" con M3 Max (consumo ~50 W). Comodo per una sessione in mobilità. Per elaborazioni in batch con un modello di grandi dimensioni, considera al massimo 1 ora di autonomia — preferisci l'alimentazione dalla rete elettrica.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.