Quale LLM su MacBook Pro M4 Pro / Max (24–128 GB) ?
Un MacBook Pro M4 Pro o Max fa girare modelli da 14B a 32B senza difficoltà e, con un M4 Max da 64 o 128 GB, un 70B in Q4 (circa 40 GB). La banda passante (273, 410 o 546 GB/s a seconda del chip) limita un 70B a circa 13–14 token al secondo; la memoria, da 24 a 128 GB, determina la dimensione del modello.
Il MacBook Pro M4 è il portatile più adatto ai grandi modelli locali, a condizione di scegliere bene il chip e la memoria. Questa pagina mostra quale configurazione corrisponde a quale dimensione del modello, calcola la velocità massima teorica e confronta la macchina con una GPU NVIDIA, un Mac Studio o un Air.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#MacBook Pro M4 Pro e M4 Max: quali configurazioni, quale banda passante
Su un MacBook Pro M4, il chip determina due cose: la larghezza di banda, che determina la velocità massima di generazione, e la memoria massima, che determina la dimensione del modello. Secondo la scheda tecnica di Apple, il M4 Pro offre 273 GB/s, il M4 Max con 14 core CPU e 32 core GPU 410 GB/s, e il M4 Max con 16 core CPU e 40 core GPU 546 GB/s. La memoria va da 24 GB a 128 GB a seconda del chip. Non sono opzioni intercambiabili: ogni chip consente di usare una specifica classe di modelli.
| Chip | Larghezza di banda | Memoria offerta | Classe dimensionale del modello realisticamente utilizzabile (Q4) |
|---|---|---|---|
| M4 Pro | 273 GB/s | 24 o 48 GB | Fino a 14B senza difficoltà, 24–27B con 48 GB |
| M4 Max 14 nuclei CPU, 32 nuclei GPU | 410 GB/s | 36 GB | 24-27B senza difficoltà, 32B con contesto breve |
| M4 Max con 16 core CPU e 40 core GPU | 546 GB/s | 48, 64 o 128 GB | 32B senza problemi; 70B a partire da 64 GB; architetture MoE superiori a 100B con 128 GB |
Apple specifica che il M4 Max supporta fino a 128 GB di memoria unificata e che ciò permette agli sviluppatori di interagire con modelli linguistici da quasi 200 miliardi di parametri. Apple non specifica né la quantizzazione né il contesto di questo dato: non leggerlo come una promessa per un modello denso in Q4, perché un 70B denso pesa già circa 40 GB secondo i valori di riferimento del sito.
La scheda descrive il MacBook Pro da 14 pollici; il modello da 16 pollici utilizza gli stessi chip. Ai chip M4 è poi seguita una generazione M5: i modelli della generazione descritta qui non sono più sempre disponibili nuovi, e il mercato dell'usato ne determina il prezzo. Questa pagina non cita alcun prezzo; la pagina /materiel-ia/macbook-pro-m4-max fornisce riferimenti aggiornati.
#Pro, Max a 14 o a 16 core: come scegliere
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- 01Definisci prima la dimensione desiderata del modelloUn modello da 8 a 14 miliardi di parametri può essere eseguito su un M4 Pro da 24 GB. Un modello da 24 a 32B richiede da 36 a 48 GB. Un modello da 70B richiede almeno 64 GB, con un contesto breve.
- 02Aggiungi il contesto e un margine compreso tra il 25 e il 30%La cache KV cresce con la lunghezza del contesto e macOS riserva una parte della memoria per sé. Moltiplica il peso del modello per circa 1,3 per una stima prudente.
- 03Verifica la banda passante rispetto alla velocità desiderataDividi la banda passante per la dimensione del modello: è la velocità massima teorica. Se è troppo bassa per l'uso previsto, passa a un chip di fascia superiore anziché aumentare la memoria.
- 04Decidi tra un chip Max da 14 o da 16 coreIl modello a 16 core offre 546 GB/s contro 410 GB/s e soprattutto la possibilità di avere 48, 64 e 128 GB di memoria: la memoria, tanto quanto la velocità, giustifica la differenza.
Questa procedura spiega perché l’M4 Pro da 48 GB e l’M4 Max a 14 core da 36 GB non sono comparabili: il primo offre più memoria, il secondo più larghezza di banda. Per un uso in cui il modello è piccolo e le risposte devono essere rapide, il Max a 14 core vince. Per caricare un modello più grande, vince il Pro da 48 GB, anche a costo di generare più lentamente.
#Ciò che la banda passante permette: limiti teorici
Per ogni token generato vengono riletti i pesi attivi. La velocità massima è quindi la larghezza di banda divisa per il peso in gigabyte, usando i valori di riferimento del sito: 14B circa 9 GB, 32B circa 19-20 GB, 70B circa 40 GB in Q4. La tabella applica questa formula ai tre chip. Si tratta di limiti massimi calcolati, mai di misurazioni: la velocità reale dipende dal motore, dal contesto e dal carico termico.
| Modello denso | Dimensione del modello | M4 Pro (273 GB/s) | M4 Max 14 c. (410 GB/s) | M4 Max 16 c. (546 GB/s) |
|---|---|---|---|---|
| 14B | ≈ 9 GB | ≈ 30 tok/s | ≈ 45 tok/s | ≈ 60 tok/s |
| 32B | ≈ 19–20 GB | ≈ 14 tok/s | ≈ 21 tok/s | ≈ 28 tok/s |
| 70B | ≈ 40 GB | fuori portata (memoria) | fuori portata (memoria) | ≈ 13–14 tok/s |
I modelli a esperti (MoE) non rientrano in questa tabella: un 30B con 3B attivi occupa circa 19 GB in memoria ma rilegge solo pochi gigabyte di pesi per token, quindi il suo limite massimo è diverse volte superiore a quello di un 32B denso con lo stesso peso. È la scelta più conveniente per un MacBook Pro con 48 GB o più. Le velocità effettive si possono consultare su /benchmarks o nei benchmark pubblicati da terzi, verificando chip, quantizzazione e motore.
#MLX, Ollama, LM Studio : quale motore su questa macchina
Ollama copre l'essenziale: installazione in un clic, API locale, rilevamento automatico della GPU. MLX, il framework di Apple, sfrutta la memoria condivisa del Mac senza copie tra CPU e GPU; il suo pacchetto mlx-lm permette di generare testo e di fare fine-tuning dei modelli su Apple silicon, supportando i modelli quantizzati. LM Studio offre un'interfaccia grafica e modelli MLX. La guida comparativa MLX contro llama.cpp chiarisce quale offre le prestazioni migliori; non c'è bisogno di ripetere le sue conclusioni qui.
- 01Installare OllamaScaricalo su ollama.com o con Homebrew. L'avvio automatico è descritto nel manuale di installazione per macOS.
- 02Avviare il modello sceltoL'ordine ollama run t scarica poi esegue il modello. Verifica successivamente il GPU con ollama ps.
- 03Regolare la cache KV e la Flash AttentionOllama attiva automaticamente Flash Attention quando l'hardware lo permette; la variabile OLLAMA_KV_CACHE_TYPE quantizza la cache KV, con f16 come valore predefinito. Riduce la memoria occupata dai contesti lunghi.
- 04Aumentare il limite di memoria GPU se necessarioIl repository mlx-lm indica che un modello che entra nella RAM può spesso essere accelerato aumentando il limite della memoria non paginabile (wired) del sistema. È un'impostazione di sistema che richiede privilegi di amministratore: segui la procedura della guida all'ottimizzazione di macOS, senza copiare valori trovati altrove.
#Contesto lungo: il caso d'uso in cui la memoria del Pro conta di più
Il contesto lungo è il principale argomento a favore dei 64 e 128 GB. Ollama imposta per default un contesto di 4 000 token con meno di 24 GiB di memoria, di 32 000 tra 24 e 48 GiB e di 256 000 a partire da 48 GiB; la sua documentazione raccomanda almeno 64 000 token per la ricerca web, gli agenti e gli strumenti di programmazione. Un contesto di 64 000 token su un modello da 32B richiede gigabyte di cache KV, oltre ai 19-20 GB dei pesi: con 48 GB, il margine si esaurisce in fretta. Una macchina da 64 GB o 128 GB lascia spazio a questo contesto senza obbligare a quantizzare la cache.
#MacBook Pro M4 a confronto con una GPU NVIDIA, un Mac Studio o un Air
Il confronto utile riguarda prima la memoria, poi la velocità. Una RTX 4090 dispone di 24 GB di GDDR6X, secondo NVIDIA: oltre la fascia di modelli da 24 a 30 miliardi di parametri, deve trasferire parte del modello nella RAM di sistema e la velocità cala. Un MacBook Pro M4 Max con 64 o 128 GB carica un intero modello 70B. La scheda resta superiore quando il modello entra nella sua memoria e la velocità è la priorità.
| Situazione | Migliore opzione | Motivo |
|---|---|---|
| Modello da 8 a 14B, mobilità, silenzio | MacBook Air M4 16 o 24 GB | È sufficiente ed è più leggero |
| Modello da 24 a 32B, più modelli aperti | MacBook Pro M4 Pro 48 GB o Max | Memoria e ventilazione attiva |
| Modello da 70B o contesto molto lungo, in mobilità | MacBook Pro M4 Max 64 o 128 GB | Unico laptop in grado di caricare interamente un 70B |
| Stesso carico, ma in ufficio | Mac Studio o Mac mini | Stesso chip, sistema di raffreddamento più ampio, nessuna batteria |
| Modello che rientra in 24 GB, velocità massima | GPU NVIDIA da 24 GB in su | Banda passante superiore quando il modello entra in memoria |
#M4 o M5: cosa cambia nella generazione successiva
Apple ha nel frattempo rilasciato i MacBook Pro M5 Pro e M5 Max. La loro scheda tecnica indica 307 GB/s per il M5 Pro, 460 GB/s per il M5 Max con 32 core GPU e 614 GB/s per il M5 Max con 40 core GPU, contro 273, 410 e 546 GB/s per la generazione M4. La larghezza di banda aumenta di circa il 12–13%, e quindi anche i limiti teorici di velocità. La scelta d'acquisto va valutata soprattutto a parità di memoria: un M4 Max da 128 GB usato permette di eseguire più modelli di un M5 Pro da 48 GB nuovo.
| Chip | M4 | M5 |
|---|---|---|
| Pro | 273 GB/s | 307 GB/s |
| Max, 32 core GPU | 410 GB/s | 460 GB/s |
| Max, 40 core GPU | 546 GB/s | 614 GB/s |
#Limiti da conoscere
- Limite di memoria
- Massimo 128 GB. Al di sopra, serve un Mac Studio o un'altra piattaforma.
- Niente CUDA
- Le librerie che richiedono CUDA non funzionano. MLX e llama.cpp coprono l'inferenza, non tutto l'ecosistema di training.
- Fine-tuning
- MLX permette un fine-tuning a basso rango e completo con modelli quantizzati. Su modelli con più di alcuni miliardi di parametri, rimane lento e genera calore: riserva i lavori pesanti a un servizio cloud.
- Batteria
- L'inferenza continua scarica rapidamente la batteria: collega il computer all'alimentazione per le sessioni lunghe.
- MacBook Air M4: 32 GB e 120 GB/s
- Mac Studio: lo stesso chip in un computer desktop
- Mac mini M4 e M4 Pro
- Ottimizzare un Mac Apple Silicon
- Scheda hardware: MacBook Pro M4 Max
- Fonte: scheda tecnica Apple del MacBook Pro M4 Pro e M4 Max
- Fonte: scheda tecnica Apple del MacBook Pro M5 Pro e M5 Max
- Fonte: Apple, annuncio dei chip M4 Pro e M4 Max
- Fonte: documentazione Ollama, contesto
- Fonte: repository mlx-lm
#Domande frequenti
Il MacBook Pro M4 Max è migliore di una RTX 4090 per gli LLM?+
M4 Pro 48 GB o M4 Max 36 GB: quale scegliere?+
Servono 64 o 128 GB di memoria su un M4 Max?+
Quale velocità ci si può aspettare da un 70B su un MacBook Pro M4 Max?+
È possibile fare il fine-tuning di un modello su un MacBook Pro M4?+
Ollama, LM Studio o MLX su un MacBook Pro M4?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.