Quale LLM su MacBook Pro M3 Pro / Max (18–128 GB) ?
Il MacBook Pro M3 Pro / Max (fine 2023) è nel 2026 il punto di equilibrio ideale tra i laptop per gli LLM locali. L'M3 Max a 16 core offre 400 GB/s di larghezza di banda e fino a 128 GB di memoria unificata — abbastanza per eseguire tutto il catalogo open-weight del 2026 a piena precisione: Qwen 3.6 35B-A3B in Q8, Qwen 3.8 27B in versione densa, oppure più modelli caricati in parallelo con contesti di 128k e oltre. Attenzione: l'M3 Pro ha subito una riduzione della larghezza di banda della memoria (150 GB/s, contro i 200 dell'M2 Pro). Questa guida chiarisce cosa permette davvero ciascuna variante.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#MBP M3 Pro / Max nel 2026
- Data di uscita
- Ottobre-novembre 2023. Ancora supportato da macOS Sequoia e dalle versioni successive.
- M3 Pro
- 11 o 12 nuclei CPU + 14 o 18 nuclei GPU, 150 GB/s (riduzione rispetto al M2 Pro), RAM 18 o 36 GB
- M3 Max 14-core
- 14 core CPU + 30 core GPU, 300 GB/s, RAM 36 o 96 GB.
- M3 Max 16-core
- 16 core CPU + 40 core GPU, 400 GB/s, RAM 48, 64 o 128 GB.
#1. M3 Pro vs M3 Max (attenzione alla trappola)
- M3 Pro 150 GB/s
- Adeguato per i modelli da 9B-12B (~30 tok/s), ma fatica con i modelli densi da 24B+ (~12 tok/s). Evitalo se punti a modelli densi da 24B+.
- M3 Max 14-core 300 GB/s
- Un buon compromesso: Qwen 3.6 35B-A3B (MoE) a 35-38 tok/s, Qwen 3.8 27B denso a 15-17 tok/s. RAM massima: 96 GB.
- M3 Max 16-core 400 GB/s
- La fascia alta. +30 % di velocità sui modelli di grandi dimensioni, con la possibilità di avere 128 GB di RAM per la piena precisione Q8 e più modelli in parallelo.
#2. Da 18 a 128 GB: quali LLM
| Modello | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 30 | ✓ 32 | ✓ 46 | ✓ 48 | ✓ 50 |
| Gemma 4 12B | Q5_K_M | ✓ 14 | ✓ 16 | ✓ 26 | ✓ 28 | ✓ 30 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 3.8 27B | Q5_K_M | — | — | ✓ 15 | ✓ 16 | ✓ 17 |
| Qwen 3.6 35B-A3B | Q5_K_M | — | — | ✓ 38 | ✓ 40 | ✓ 42 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 32 | ✓ 34 | ✓ 36 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 33 | ✓ 35 | ✓ 37 |
| GLM 4.7 Flash | Q4_K_M | — | — | ✓ 44 | ✓ 46 | ✓ 48 |
#3. Benchmark token/sec
| Modello | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Qwen 3.5 9B | 54 t/s | 50 t/s | 48 t/s |
| Gemma 4 12B | 34 t/s | 30 t/s | 29 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 3.8 27B | 19 t/s | 17 t/s | 16 t/s |
| Qwen 3.6 35B-A3B | 46 t/s | 42 t/s | 40 t/s |
#4. Installazione e configurazione
#5. Grandi modelli a piena precisione con Flash Attention
Flash Attention, a lungo riservato a CUDA, è ora disponibile su Metal da fine 2024 attraverso llama.cpp e Ollama. Grande vantaggio sui contesti lunghi — indispensabile per spingere un Qwen 3.6 35B-A3B a 128k di contesto.
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
#6. Il M3 Max da 128 GB: siamo nel territorio delle workstation
- Qwen 3.6 35B-A3B Q8
- Piena precisione, qualità massima. ~36 token/s (MoE, 3B attivi). La versione da 128 GB permette di usare Q8 senza compromessi sul contesto.
- Qwen 3.8 27B Q8
- Il più grande modello generalista denso a piena precisione (~29 GB). ~15 tok/s. Il modello «vicino a Copilot» del 2026, con capacità visive incluse.
- 2 modelli 30B in parallelo
- Un Qwen 3.6 35B-A3B + un Qwen3-Coder 30B-A3B caricati contemporaneamente. ~42 GB totali. Per agenti con più specializzazioni.
- Contesto 128k+ su 35B
- Con la cache KV Q8, Qwen 3.6 35B-A3B + contesto 128k rientra in circa 50 GB. Analisi approfondita di documenti lunghi.
#M3 Max vs M4 Max
- Larghezza di banda
- M3 Max 16-core = 400 GB/s. M4 Max 16-core = 546 GB/s (+36 %).
- Velocità Qwen 3.6 35B-A3B
- M3 Max ~40 tok/s, M4 Max ~54 tok/s. +35 % in uso reale.
- RAM massima
- Identico: 128 GB nelle due configurazioni top.
- Verdetto
- M4 Max se acquisti nuovo. Anche un M3 Max usato a un prezzo inferiore del 25% è un ottimo affare.
#Domande frequenti
Il M3 Pro è veramente più lento del M2 Pro per gli LLM?+
Quale MBP M3 usare per eseguire grandi modelli nel 2026?+
Differenza tra M3 Max 14-core e 16-core in pratica?+
128 GB di RAM sono davvero utili nel 2026?+
Flash Attention cambia davvero qualcosa sul M3 Max?+
Autonomia della batteria durante una chat con un modello di grandi dimensioni?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.