Intermedio 11 minMacBook Pro

Quale LLM su MacBook Pro M1 Pro / Max (16–64 GB) ?

Uscito alla fine del 2021, il MacBook Pro M1 Pro / Max rimane nel 2026 una macchina notevole per l'IA locale, soprattutto nella versione Max da 64 GB. Larghezza di banda da 200 a 400 GB/s, ventole attive (nessun throttling), fino a 64 GB di memoria unificata: un MoE Qwen 3.6 35B gira a circa 34 token al secondo e un modello 30B entra in memoria in Q8 a piena qualità, cosa impossibile su un PC portatile equivalente destinato al grande pubblico. Questa guida spiega in dettaglio come sfruttare questa macchina oggi.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#MBP M1 Pro / Max nel 2026

Data di uscita
Ottobre 2021. Ancora supportato da macOS Sequoia (15) nel 2026.
M1 Pro
8 o 10 core CPU + 14 o 16 core GPU, banda passante 200 GB/s, RAM 16 o 32 GB.
M1 Max
10 core CPU + 24 o 32 core GPU, larghezza di banda di 400 GB/s, RAM da 32 o 64 GB.
Raffreddamento
Ventole attive — nessun throttling durante l'uso di LLM. Può funzionare ininterrottamente per 24 ore.
Valore dell'usato nel 2026
MBP M1 Pro e M1 Max: usati, prezzo variabile in base alle condizioni.
→
Perché è un affare nel 2026
Un MBP M1 Max da 64 GB usato (prezzo variabile) fa girare i migliori modelli MoE del 2026 (Qwen 3.6 35B, Qwen3-Coder 30B) in Q8, a piena qualità. Per ottenere la stessa capacità LLM su PC, servono 2 × RTX 3090 (usate, prezzo variabile) + una CPU, una scheda madre e un alimentatore compatibili (~800 €): il risultato è una spesa complessiva significativa e un sistema rumoroso e dai consumi elevati.

#1. M1 Pro vs M1 Max: scegli

M1 Pro (200 GB/s)
Eccellente per i modelli 8-12B. Un MoE 30-35B (Qwen 3.6 35B-A3B) entra nella memoria della versione da 32 GB, ma non in quella da 16 GB.
M1 Max (400 GB/s)
2× la banda passante = 2× la velocità di inferenza sui modelli ≥ 13B. Indispensabile per eseguire un 30B in Q8 alla massima qualità.
Nuclei GPU
M1 Max 32-core è 15-20% più veloce del 24-core sui modelli 8B. La differenza si accentua sui modelli 27-35B.

#2. 16, 32, 64 GB: quali modelli

Modelli consigliati per configurazione MBP M1
ModelloQuantRAM modelloM1 Pro 16 GBM1 Pro 32 GBM1 Max 64 GB
Qwen 3.5 9BQ5_K_M7 GB283143
Granite 4.2 8BQ5_K_M6 GB303447
Gemma 4 12BQ5_K_M9 GB182130
Qwen 3.8 27BQ4_K_M18 GB—1118
Mistral Small 24BQ5_K_M16 GB—1018
Qwen 3.6 35B-A3B (MoE)Q4_K_M23 GB—2234
Qwen3-Coder 30B-A3BQ8_032 GB——24

#3. Benchmark token/sec

MBP M1 Max con GPU a 32 core, 64 GB, Ollama, alimentazione da rete elettrica — ordini di grandezza
ModelloQ4_K_MQ5_K_MQ8_0
Qwen 3.5 9B46 t/s43 t/s28 t/s
Granite 4.2 8B50 t/s47 t/s30 t/s
Gemma 4 12B32 t/s30 t/s19 t/s
Qwen 3.8 27B18 t/s16 t/s10 t/s
Qwen 3.6 35B-A3B34 t/s—22 t/s

#4. Installazione e setup

Terminale — setup completo
# Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Ollama + démarrage auto
brew install --cask ollama
brew services start ollama

# Modèles conseillés
ollama run qwen3.5:9b        # M1 Pro 16 Go
ollama run qwen3.8:27b       # M1 Pro 32 Go
ollama run qwen3.6:35b       # M1 Max 64 Go (MoE 35B)

#5. Aumentare il limite di memoria della GPU

Su un MBP M1 Max con 64 GB, macOS assegna per impostazione predefinita circa 43 GB alla GPU. Per caricare un modello da 30-35B in Q8 (~35 GB) con un contesto esteso — la cache KV di un contesto da 256k può da sola superare 10 GB — il totale supera rapidamente i 43 GB e occorre aumentare il limite.

Il kit Mac

Il tuo MacBook Pro M1 può far girare più di quanto pensi. Il kit Mac mostra come spingere oltre il limite di memoria della GPU (cap. 2), scegliere il modello adatto al tuo chip (cap. 4) e risolvere i problemi: Metal, memoria, swap (cap. 14).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Aumentare la memoria GPU allocabile
# Vérifier la valeur actuelle
sysctl iogpu.wired_limit_mb

# Relever à 56 Go (64 Go - 8 Go système)
sudo sysctl iogpu.wired_limit_mb=57344

# Rendre permanent
echo "iogpu.wired_limit_mb=57344" | sudo tee -a /etc/sysctl.conf
!
Lascia ≥ 8 GB a macOS
Al di sotto di questa soglia, il sistema ricorre allo swap e l'inferenza rallenta drasticamente. 8 GB sono il margine minimo su un MBP da 64 GB; limitati a 6 GB solo se chiudi tutte le app Electron e non usi un browser.

#6. Eseguire un modello di grandi dimensioni del 2026 su M1 Max

Il MBP M1 Max da 64 GB esegue i modelli più grandi del 2026 alla massima qualità: un MoE 30-35B in Q8, oppure diversi modelli caricati in parallelo. Ecco la configurazione ottimale:

MoE Qwen 3.6 35B su M1 Max 64 GB
# Augmenter la RAM GPU (fait une seule fois)
sudo sysctl iogpu.wired_limit_mb=57344

# Activer flash attention + KV cache quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
brew services restart ollama

# Lancer le modèle
ollama run qwen3.6:35b
# Comptez ~34 tokens/seconde (MoE, 3B actifs) — contexte étendu confortable
i
Autonomia della batteria con modelli di grandi dimensioni
Circa 1 h 30 min di autonomia in chat continua con un MoE da 35B (consumo ~40 W). Per sessioni lunghe, collega il computer all'alimentazione — il MBP M1 Max limita fortemente la GPU quando la batteria è scarica.

#Passare a M3 Max o M4 Max?

M3 Max 16-core (2023)
+50% di velocità pura rispetto al M1 Max. 128 GB di RAM disponibili (rispetto ai 64 GB). Giustifica l'aggiornamento se vuoi spingere un MoE 30-35B oltre i 50 tok/s.
M4 Max 16-core (2024)
+90 % rispetto all'M1 Max, banda passante 546 GB/s. 128 GB RAM. Miglior laptop Mac per LLM nel 2026.
Restare su M1 Max 64 GB
Del tutto fattibile: MoE 35B a circa 34 tok/s, 27B denso a 18 tok/s. Nessun motivo per aggiornare prima del 2027 se la velocità attuale ti soddisfa.

#Domande frequenti

MBP M1 Pro 16 GB o M1 Max 32 GB per l'IA locale?+
Il M1 Max 32 GB per un vero vantaggio: doppia banda passante (400 vs 200 GB/s) = doppia velocità su 13B+, e 20 GB in più disponibili. Tuttavia, per eseguire solamente modelli da 8 a 9B, il M1 Pro 16 GB basta ampiamente.
È possibile eseguire un modello di grandi dimensioni su un MBP M1 Max con 32 GB?+
Sì: un MoE 30-35B in Q4 (~23 GB, come Qwen 3.6 35B-A3B) rientra nei 32 GB e funziona velocemente grazie ai suoi 3B di parametri attivi. Tuttavia, un modello 30B in Q8 (~32 GB) o un modello denso ≥ 27B in Q8 saturano i 32 GB: passa quindi a 64 GB.
Il MBP M1 Pro è meglio di un PC RTX 3060 per gli LLM?+
Per Qwen 3.5 9B Q4: velocità comparabile (30-45 tok/s). Vantaggio Mac: 16 GB utilizzabili rispetto ai 12 GB di VRAM, silenzio, nessun driver. Vantaggio PC: ecosistema CUDA, fine-tuning più semplice.
Le ventole girano ad alta velocità durante l'inferenza di un LLM?+
Udibile durante una chat continua con un modello di grandi dimensioni (RPM ~4000, paragonabile a un MacBook Pro Intel 2019 durante la compilazione). Poco rumoroso con modelli da 8-12B (RPM ~2500). Molto meno rumoroso di un portatile PC da gaming con lo stesso carico sulla GPU.
Serve uno schermo da 16" o da 14" per gli LLM?+
Nessun impatto sulle prestazioni. Il modello da 16" ha una migliore dissipazione termica (scocca più grande), quindi regge il carico un po' più a lungo. 14" se la portabilità è prioritaria, 16" se contano di più le sessioni lunghe.
Ollama o MLX su MBP M1 Max?+
Ollama rimane la base per il 95% degli usi (semplice, robusta, API OpenAI). MLX è interessante per il fine-tuning di un 8-9B in locale o per modelli nativi MLX che beneficiano del M1 Max. I due coesistono senza conflitti.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.