Intermedio 11 minMacBook Pro

Quale LLM su MacBook Pro M4 Pro / Max (24–128 GB) ?

Risposta diretta

Un MacBook Pro M4 Pro o Max fa girare modelli da 14B a 32B senza difficoltà e, con un M4 Max da 64 o 128 GB, un 70B in Q4 (circa 40 GB). La banda passante (273, 410 o 546 GB/s a seconda del chip) limita un 70B a circa 13–14 token al secondo; la memoria, da 24 a 128 GB, determina la dimensione del modello.

Il MacBook Pro M4 è il portatile più adatto ai grandi modelli locali, a condizione di scegliere bene il chip e la memoria. Questa pagina mostra quale configurazione corrisponde a quale dimensione del modello, calcola la velocità massima teorica e confronta la macchina con una GPU NVIDIA, un Mac Studio o un Air.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#MacBook Pro M4 Pro e M4 Max: quali configurazioni, quale banda passante

Su un MacBook Pro M4, il chip determina due cose: la larghezza di banda, che determina la velocità massima di generazione, e la memoria massima, che determina la dimensione del modello. Secondo la scheda tecnica di Apple, il M4 Pro offre 273 GB/s, il M4 Max con 14 core CPU e 32 core GPU 410 GB/s, e il M4 Max con 16 core CPU e 40 core GPU 546 GB/s. La memoria va da 24 GB a 128 GB a seconda del chip. Non sono opzioni intercambiabili: ogni chip consente di usare una specifica classe di modelli.

Configurazioni del MacBook Pro M4 Pro e M4 Max, secondo Apple
ChipLarghezza di bandaMemoria offertaClasse dimensionale del modello realisticamente utilizzabile (Q4)
M4 Pro273 GB/s24 o 48 GBFino a 14B senza difficoltà, 24–27B con 48 GB
M4 Max 14 nuclei CPU, 32 nuclei GPU410 GB/s36 GB24-27B senza difficoltà, 32B con contesto breve
M4 Max con 16 core CPU e 40 core GPU546 GB/s48, 64 o 128 GB32B senza problemi; 70B a partire da 64 GB; architetture MoE superiori a 100B con 128 GB

Apple specifica che il M4 Max supporta fino a 128 GB di memoria unificata e che ciò permette agli sviluppatori di interagire con modelli linguistici da quasi 200 miliardi di parametri. Apple non specifica né la quantizzazione né il contesto di questo dato: non leggerlo come una promessa per un modello denso in Q4, perché un 70B denso pesa già circa 40 GB secondo i valori di riferimento del sito.

La scheda descrive il MacBook Pro da 14 pollici; il modello da 16 pollici utilizza gli stessi chip. Ai chip M4 è poi seguita una generazione M5: i modelli della generazione descritta qui non sono più sempre disponibili nuovi, e il mercato dell'usato ne determina il prezzo. Questa pagina non cita alcun prezzo; la pagina /materiel-ia/macbook-pro-m4-max fornisce riferimenti aggiornati.

#Pro, Max a 14 o a 16 core: come scegliere

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
  1. 01
    Definisci prima la dimensione desiderata del modello
    Un modello da 8 a 14 miliardi di parametri può essere eseguito su un M4 Pro da 24 GB. Un modello da 24 a 32B richiede da 36 a 48 GB. Un modello da 70B richiede almeno 64 GB, con un contesto breve.
  2. 02
    Aggiungi il contesto e un margine compreso tra il 25 e il 30%
    La cache KV cresce con la lunghezza del contesto e macOS riserva una parte della memoria per sé. Moltiplica il peso del modello per circa 1,3 per una stima prudente.
  3. 03
    Verifica la banda passante rispetto alla velocità desiderata
    Dividi la banda passante per la dimensione del modello: è la velocità massima teorica. Se è troppo bassa per l'uso previsto, passa a un chip di fascia superiore anziché aumentare la memoria.
  4. 04
    Decidi tra un chip Max da 14 o da 16 core
    Il modello a 16 core offre 546 GB/s contro 410 GB/s e soprattutto la possibilità di avere 48, 64 e 128 GB di memoria: la memoria, tanto quanto la velocità, giustifica la differenza.

Questa procedura spiega perché l’M4 Pro da 48 GB e l’M4 Max a 14 core da 36 GB non sono comparabili: il primo offre più memoria, il secondo più larghezza di banda. Per un uso in cui il modello è piccolo e le risposte devono essere rapide, il Max a 14 core vince. Per caricare un modello più grande, vince il Pro da 48 GB, anche a costo di generare più lentamente.

#Ciò che la banda passante permette: limiti teorici

Per ogni token generato vengono riletti i pesi attivi. La velocità massima è quindi la larghezza di banda divisa per il peso in gigabyte, usando i valori di riferimento del sito: 14B circa 9 GB, 32B circa 19-20 GB, 70B circa 40 GB in Q4. La tabella applica questa formula ai tre chip. Si tratta di limiti massimi calcolati, mai di misurazioni: la velocità reale dipende dal motore, dal contesto e dal carico termico.

Limite teorico di generazione (pesi in Q4): calcolo, non misurazione
Modello densoDimensione del modelloM4 Pro (273 GB/s)M4 Max 14 c. (410 GB/s)M4 Max 16 c. (546 GB/s)
14B≈ 9 GB≈ 30 tok/s≈ 45 tok/s≈ 60 tok/s
32B≈ 19–20 GB≈ 14 tok/s≈ 21 tok/s≈ 28 tok/s
70B≈ 40 GBfuori portata (memoria)fuori portata (memoria)≈ 13–14 tok/s

I modelli a esperti (MoE) non rientrano in questa tabella: un 30B con 3B attivi occupa circa 19 GB in memoria ma rilegge solo pochi gigabyte di pesi per token, quindi il suo limite massimo è diverse volte superiore a quello di un 32B denso con lo stesso peso. È la scelta più conveniente per un MacBook Pro con 48 GB o più. Le velocità effettive si possono consultare su /benchmarks o nei benchmark pubblicati da terzi, verificando chip, quantizzazione e motore.

!
Diffida delle velocità di generazione indicate senza contesto
Una velocità dichiarata superiore a 30 token al secondo per un modello denso da 32B in Q4 su un M4 Max con una banda passante di 546 GB/s supera il limite teorico di 28: non deriva da una generazione classica. Controlla sempre quale modello è attivo, quale quantizzazione viene usata e se un modello draft accelera la generazione.

#MLX, Ollama, LM Studio : quale motore su questa macchina

Ollama copre l'essenziale: installazione in un clic, API locale, rilevamento automatico della GPU. MLX, il framework di Apple, sfrutta la memoria condivisa del Mac senza copie tra CPU e GPU; il suo pacchetto mlx-lm permette di generare testo e di fare fine-tuning dei modelli su Apple silicon, supportando i modelli quantizzati. LM Studio offre un'interfaccia grafica e modelli MLX. La guida comparativa MLX contro llama.cpp chiarisce quale offre le prestazioni migliori; non c'è bisogno di ripetere le sue conclusioni qui.

  1. 01
    Installare Ollama
    Scaricalo su ollama.com o con Homebrew. L'avvio automatico è descritto nel manuale di installazione per macOS.
  2. 02
    Avviare il modello scelto
    L'ordine ollama run t scarica poi esegue il modello. Verifica successivamente il GPU con ollama ps.
  3. 03
    Regolare la cache KV e la Flash Attention
    Ollama attiva automaticamente Flash Attention quando l'hardware lo permette; la variabile OLLAMA_KV_CACHE_TYPE quantizza la cache KV, con f16 come valore predefinito. Riduce la memoria occupata dai contesti lunghi.
  4. 04
    Aumentare il limite di memoria GPU se necessario
    Il repository mlx-lm indica che un modello che entra nella RAM può spesso essere accelerato aumentando il limite della memoria non paginabile (wired) del sistema. È un'impostazione di sistema che richiede privilegi di amministratore: segui la procedura della guida all'ottimizzazione di macOS, senza copiare valori trovati altrove.
Terminale
brew install --cask ollama
ollama run qwen3:32b
ollama ps

# Long contexte : cache KV quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

#Contesto lungo: il caso d'uso in cui la memoria del Pro conta di più

Il contesto lungo è il principale argomento a favore dei 64 e 128 GB. Ollama imposta per default un contesto di 4 000 token con meno di 24 GiB di memoria, di 32 000 tra 24 e 48 GiB e di 256 000 a partire da 48 GiB; la sua documentazione raccomanda almeno 64 000 token per la ricerca web, gli agenti e gli strumenti di programmazione. Un contesto di 64 000 token su un modello da 32B richiede gigabyte di cache KV, oltre ai 19-20 GB dei pesi: con 48 GB, il margine si esaurisce in fretta. Una macchina da 64 GB o 128 GB lascia spazio a questo contesto senza obbligare a quantizzare la cache.

#MacBook Pro M4 a confronto con una GPU NVIDIA, un Mac Studio o un Air

Il confronto utile riguarda prima la memoria, poi la velocità. Una RTX 4090 dispone di 24 GB di GDDR6X, secondo NVIDIA: oltre la fascia di modelli da 24 a 30 miliardi di parametri, deve trasferire parte del modello nella RAM di sistema e la velocità cala. Un MacBook Pro M4 Max con 64 o 128 GB carica un intero modello 70B. La scheda resta superiore quando il modello entra nella sua memoria e la velocità è la priorità.

Dove posizionare il MacBook Pro M4 rispetto ad altre opzioni
SituazioneMigliore opzioneMotivo
Modello da 8 a 14B, mobilità, silenzioMacBook Air M4 16 o 24 GBÈ sufficiente ed è più leggero
Modello da 24 a 32B, più modelli apertiMacBook Pro M4 Pro 48 GB o MaxMemoria e ventilazione attiva
Modello da 70B o contesto molto lungo, in mobilitàMacBook Pro M4 Max 64 o 128 GBUnico laptop in grado di caricare interamente un 70B
Stesso carico, ma in ufficioMac Studio o Mac miniStesso chip, sistema di raffreddamento più ampio, nessuna batteria
Modello che rientra in 24 GB, velocità massimaGPU NVIDIA da 24 GB in suBanda passante superiore quando il modello entra in memoria

#M4 o M5: cosa cambia nella generazione successiva

Apple ha nel frattempo rilasciato i MacBook Pro M5 Pro e M5 Max. La loro scheda tecnica indica 307 GB/s per il M5 Pro, 460 GB/s per il M5 Max con 32 core GPU e 614 GB/s per il M5 Max con 40 core GPU, contro 273, 410 e 546 GB/s per la generazione M4. La larghezza di banda aumenta di circa il 12–13%, e quindi anche i limiti teorici di velocità. La scelta d'acquisto va valutata soprattutto a parità di memoria: un M4 Max da 128 GB usato permette di eseguire più modelli di un M5 Pro da 48 GB nuovo.

Banda passante dei chip Pro e Max, M4 e M5, secondo Apple
ChipM4M5
Pro273 GB/s307 GB/s
Max, 32 core GPU410 GB/s460 GB/s
Max, 40 core GPU546 GB/s614 GB/s

#Limiti da conoscere

Limite di memoria
Massimo 128 GB. Al di sopra, serve un Mac Studio o un'altra piattaforma.
Niente CUDA
Le librerie che richiedono CUDA non funzionano. MLX e llama.cpp coprono l'inferenza, non tutto l'ecosistema di training.
Fine-tuning
MLX permette un fine-tuning a basso rango e completo con modelli quantizzati. Su modelli con più di alcuni miliardi di parametri, rimane lento e genera calore: riserva i lavori pesanti a un servizio cloud.
Batteria
L'inferenza continua scarica rapidamente la batteria: collega il computer all'alimentazione per le sessioni lunghe.

#Domande frequenti

FAQ
Il MacBook Pro M4 Max è migliore di una RTX 4090 per gli LLM?+
Tutto dipende dalla dimensione del modello. La RTX 4090 ha 24 GB di memoria: oltre questa capacità, trasferisce parte del modello nella RAM di sistema e rallenta. Un M4 Max da 64 o 128 GB carica interamente un modello 70B, ma genera più lentamente di una scheda quando il modello rientra nei suoi 24 GB. Scegli in base alla dimensione del modello desiderato.
M4 Pro 48 GB o M4 Max 36 GB: quale scegliere?+
Il M4 Pro da 48 GB carica modelli più grandi, fino a un 32B in Q4 con un contesto moderato. Il M4 Max a 14 core ha una larghezza di banda di 410 GB/s contro 273, quindi genera circa il 50% più velocemente, ma i suoi 36 GB limitano le dimensioni del modello. Per un modello da 24 a 32B, la memoria ha la priorità: scegli 48 GB.
Servono 64 o 128 GB di memoria su un M4 Max?+
64 GB sono sufficienti per un 70B in Q4 (circa 40 GB) con un contesto moderato. 128 GB sono giustificati per un contesto molto lungo, modelli a esperti con più di 100 miliardi di parametri o più modelli caricati contemporaneamente. Se il tuo utilizzo rientra nei 64 GB, la memoria aggiuntiva non aumenta la velocità.
Quale velocità ci si può aspettare da un 70B su un MacBook Pro M4 Max?+
Il limite teorico è di 546 GB/s divisi per circa 40 GB, cioè da 13 a 14 token al secondo. La velocità reale è più bassa e dipende dal motore e dal contesto. Il M4 Max con 410 GB/s e 36 GB non può caricare un 70B; può farlo solo la versione da 546 GB/s con 64 o 128 GB.
È possibile fare il fine-tuning di un modello su un MacBook Pro M4?+
Sì, con MLX: il pacchetto mlx-lm supporta il fine-tuning a basso rango e completo con modelli quantizzati. In pratica, va bene per i piccoli modelli e per gli esperimenti. Per un modello con decine di miliardi di parametri, un servizio cloud rimane più veloce.
Ollama, LM Studio o MLX su un MacBook Pro M4?+
Ollama per la semplicità e l'API locale, LM Studio per l'interfaccia grafica, MLX per i formati Apple e il fine-tuning. I tre possono coesistere, ma non caricare due modelli grandi contemporaneamente: la memoria è il primo limite. La guida MLX contro llama.cpp confronta le velocità.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.