Intermedio 11 minMacBook Pro

Quale LLM su MacBook Pro M2 Pro / Max (16–96 GB) ?

Risposta diretta

Un MacBook Pro M2 Pro gestisce senza problemi un modello da 8-9B con 16 GB e uno da 24 a 32B con 32 GB; un M2 Max con 64 o 96 GB è l'unica variante di questa generazione a ospitare un 70B in Q4 (circa 40 GB) e due modelli da 20 a 30B contemporaneamente. La velocità dipende dalla banda passante: 200 GB/s per il M2 Pro, 400 GB/s per il M2 Max, cioè quasi il doppio dei token al secondo a parità di modello.

Uscito nel gennaio 2023, il MacBook Pro M2 Pro / Max resta uno dei portatili più potenti per l'IA locale: ventilatori, 400 GB/s di banda passante sul M2 Max e fino a 96 GB di memoria unificata. Questa pagina spiega cosa permette ogni configurazione di memoria, cosa dicono le misurazioni pubblicate, perché raddoppiare la banda passante non raddoppia la velocità, e in quali casi vale la pena passare a un M4 Max.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#MacBook Pro M2 Pro / Max nel 2026: la scheda tecnica utile

Alla presentazione, Apple annunciava per il M2 Pro una banda passante di 200 GB/s e fino a 32 GB di memoria unificata, e per il M2 Max 400 GB/s, fino a 96 GB e una GPU con un massimo di 38 core. Apple presentava questi 96 GB come un modo per superare i limiti della memoria grafica su un portatile. La memoria è saldata al processore, quindi scegli la configurazione all'acquisto e non puoi più modificarla.

I chip dei MacBook Pro da 14 e 16 pollici (2023)
ChipLarghezza di bandaOpzioni di memoriaGPU
M2 Pro200 GB/s16 o 32 GB16 o 19 core
M2 Max400 GB/s32, 64 o 96 GB30 o 38 core

Il raffreddamento attivo è il secondo vantaggio rispetto a un MacBook Air: il MacBook Pro può sostenere carichi prolungati senza che il chip debba rallentare in modo marcato. Apple offre anche, su alcuni modelli, una modalità Alta potenza che permette alle ventole di girare più velocemente; è un'impostazione da provare per le generazioni prolungate, al prezzo di un maggiore rumore.

#M2 Pro o M2 Max: cosa cambia davvero con la banda passante

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La generazione di testo legge a ogni token l'intero insieme dei pesi attivi del modello. La velocità massima è quindi la banda passante divisa per la dimensione dei pesi. Un M2 Max a 400 GB/s potrebbe, in teoria, essere due volte più veloce di un M2 Pro a 200 GB/s. I dati pubblicati nel repository llama.cpp mostrano che ciò avviene solo in parte.

Generazione di testo, Llama 7B, llama.cpp (discussione #4167)
Chip (core GPU)Larghezza di bandaQ4_0Q8_0F16
M2 Pro (19)200 GB/s38,86 t/s23,01 t/s13,06 t/s
M2 Max (30)400 GB/s60,99 t/s39,97 t/s24,16 t/s
M2 Max (38)400 GB/s65,95 t/s41,83 t/s24,65 t/s

Su un modello da 7B in Q4_0, l'M2 Max è solo da 1,6 a 1,7 volte più veloce dell'M2 Pro. Sullo stesso modello in F16, da circa 13 GB, il rapporto sale a quasi 1,9. Il calcolo lo spiega: un modello piccolo viene letto così rapidamente che altri limiti (calcolo, latenza, overhead) tornano a prevalere, mentre un modello grande satura davvero la memoria. La conseguenza pratica è controintuitiva: più il modello è grande, più l'M2 Max giustifica il suo prezzo. Per un 7B, un M2 Pro è più che sufficiente.

→
Ordine di grandezza per il tuo modello
Dividi la larghezza di banda per la dimensione dei pesi in Q4 riportata nel catalogo, poi sottrai dal 15 al 35% in base alla dimensione del modello: l'M2 Max raggiunge circa il 63% del limite teorico con un 7B in Q4_0 e circa l'83% con un 7B in F16. Per un modello da 19 GB come Qwen3-Coder 30B-A3B, il limite teorico dell'M2 Max è già di 21 t/s in lettura densa; i modelli MoE rileggono solo i loro parametri attivi, quindi le loro velocità effettive sono molto migliori.

#Da 16 a 96 GB: ciò che entra in memoria e ciò che ci sta a malapena

Su Apple Silicon, la GPU non ha accesso a tutta la memoria per impostazione predefinita: secondo le discussioni nel repository llama.cpp, Metal ne concede tra i due terzi e i tre quarti. Su 16 GB, considera circa 10–12 GB per il modello e il suo contesto; su 96 GB, circa 64–72 GB. Il limite può essere aumentato tramite un'impostazione di sistema descritta in dettaglio nella guida dedicata, ma superarlo può bloccare la macchina.

Peso in Q4 (catalogo QuelLLM) in base alla memoria, escluso il contesto
ModelloPesi Q4M2 Pro 16 GBM2 Pro 32 GBM2 Max 64 GBM2 Max 96 GB
Qwen 3.5 9B6 GBComodoSìSìSì
Gemma 4 12B7 GBEsattoSìSìSì
Mistral Small 3.2 24B14 GBNoSìSìSì
Qwen 3.5 27B16 GBNoSì, contesto moderatoSìSì
Qwen3-Coder 30B-A3B (MoE)19 GBNoSì, contesto moderatoSìSì
Qwen 3.6 35B-A3B (MoE)21 GBNoEsattoSìSì
Llama 3.3 70B40 GBNoNoSì, contesto breveSì

I modelli MoE come Qwen3-Coder 30B-A3B o Qwen 3.6 35B-A3B pesano 19 e 21 GB, ma attivano solo circa 3 miliardi di parametri per token: a parità di memoria, generano nettamente più velocemente di un modello denso da 27B. È l’opzione più conveniente con 32 GB. Con 96 GB, il vantaggio del M2 Max consiste più nel mantenere due modelli contemporaneamente in memoria che nel caricare un unico modello molto grande, ad esempio un modello per la chat e uno per la programmazione.

#Velocità pubblicate: ciò che si può affermare e ciò che non si può affermare

Non abbiamo misurazioni nostre su questa macchina e i token al secondo dipendono dal modello, dalla quantizzazione, dal contesto e dalla versione di llama.cpp o di Ollama. Le uniche misurazioni che citiamo sono quelle pubblicate da utenti su un Llama 7B, che danno un ordine di grandezza. Per un modello più recente, il calcolo della larghezza di banda divisa per il peso rimane il riferimento da usare, con il margine di errore indicato più sopra.

L'elaborazione del prompt segue un'altra logica: la tabella di llama.cpp indica, per lo stesso Llama 7B in F16, 384 t/s nell'elaborazione del prompt su un M2 Pro a 19 core e 756 t/s su un M2 Max a 38 core. Il numero di core GPU influisce su questa fase, non sulla generazione. Per un RAG o l'analisi di un documento lungo, un M2 Max richiederà quindi circa la metà del tempo di attesa prima della prima parola rispetto a un M2 Pro.

#Installare Ollama e utilizzarlo correttamente su Mac

Ollama richiede macOS Sonoma (14) o successivo. Su Mac, la FAQ ufficiale precisa che, quando Ollama viene eseguito come applicazione, le sue variabili d'ambiente si impostano con launchctl, poi l'applicazione deve essere riavviata. Esportare le variabili in un terminale non basta: l'applicazione non le vede.

Impostazioni utili per i grandi modelli
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

La FAQ di Ollama indica che la cache K/V quantizzata in q8_0 utilizza circa la metà della memoria del formato f16 predefinito e che Flash Attention deve essere attivo per sfruttarla. Su un 70B con un contesto lungo, è questa impostazione che permette alla cache di rientrare nella memoria disponibile. Un limite da conoscere: la quantizzazione della cache può ridurre leggermente la qualità su alcuni modelli; provala sui tuoi casi d'uso prima di mantenerla.

!
Aumenta il limite di memoria della GPU solo se sai bene cosa comporta
Il parametro iogpu.wired_limit_mb permette di allocare più memoria alla GPU, ma l'impostazione non viene mantenuta dopo il riavvio e un valore eccessivo può bloccare macOS. È descritto nella guida alle impostazioni Apple Silicon, che rimane il riferimento; applicalo solo per un modello che altrimenti non entra in memoria e lascia almeno 8 GB al sistema.

#Quale modello per quale uso

Chat generale
Un modello da 8 a 12B (Qwen 3.5 9B, Gemma 4 12B) risponde velocemente su M2 Pro; un modello da 27B diventa interessante a partire da 32 GB per un francese più curato.
Codice
Un modello MoE di codice come Qwen3-Coder 30B-A3B su 32 GB o più, oppure un modello di agente di codice da 24B come Devstral Small 2 (14 GB in Q4). Per l'autocompletamento online, un modello da 7B basta.
RAG documentale
Gemma 4 12B per la velocità, un 24B per la qualità del ragionamento; limita il contesto per non prolungare l'attesa prima della prima parola.
Analisi lunghe, agenti
Con 64 GB o più: Qwen 3.6 35B-A3B come MoE veloce, oppure un 70B per la qualità, a condizione di accettare circa 10 t/s nel migliore dei casi (400 ÷ 40).

Un aspetto a cui prestare attenzione nei modelli di ragionamento: producono lunghi blocchi di riflessione prima della risposta, moltiplicando il numero di token da generare. Su una macchina a 60 t/s, diecimila token di riflessione richiedono quasi tre minuti. Per le domande semplici, disattiva la modalità di riflessione quando il modello lo permette.

#A batteria, sotto carico prolungato: cosa cambia

Il MacBook Pro è progettato per sostenere il carico più a lungo di un Air, ma resta un portatile. Due impostazioni influiscono sulla velocità di elaborazione: la modalità di alimentazione (quando funziona a batteria, macOS può limitare la potenza) e, sui modelli che la offrono, la modalità ad alta potenza. Secondo Apple, questa modalità permette alle ventole di girare più velocemente per mantenere prestazioni migliori con carichi molto intensi, producendo più rumore. Per una generazione di diversi minuti, collega l'alimentazione e prova questa modalità.

#Conviene passare a un M4 Max?

Il M4 Max raggiunge 546 GB/s e 128 GB di memoria secondo Apple. Nella tabella di llama.cpp, un Llama 7B in Q4_0 passa da 65,95 t/s sul M2 Max 38 core a 83,06 t/s sul M4 Max 40 core: circa il 26% in più. Il vantaggio è reale per un uso intenso, ma il M2 Max 96 GB mantiene un vantaggio di capacità rispetto a un M4 Pro, limitato a 64 GB.

Quando tenere il M2 Max, quando cambiarlo
SituazioneRaccomandazione
Usi principalmente modelli da 8 a 14BUn M2 Pro con 32 GB basta; non pagare di più per la maggiore larghezza di banda
Carichi modelli da 27 a 35B ogni giornoM2 Max con 64 o 96 GB: è qui che ha senso
Vuoi eseguire comodamente un 70B o mantenere due modelli residenti in memoriaM2 Max 96 GB, oppure M4 Max 128 GB se la velocità conta
Cerchi un server senza schermoUn Mac mini M4 Pro o un Mac Studio è più adatto

#Domande frequenti

FAQ
Un MacBook Pro M2 Pro 16 GB è sufficiente per l'IA locale?+
Sì per i modelli da 8 a 9 miliardi di parametri in Q4, che pesano da 5 a 6 GB, con un contesto ragionevole. Non è adatto ai modelli da 24B in su. Poiché non è possibile aggiungere memoria in un secondo momento, scegli 32 GB se vuoi poter passare un giorno a un modello più grande.
Qual è la differenza tra M2 Max con 30 e 38 core GPU?+
Entrambi hanno 400 GB/s di larghezza di banda. Nelle misurazioni di llama.cpp, la generazione di testo è solo circa l'8% più veloce con 38 core (65,95 contro 60,99 t/s in Q4_0), perché dipende dalla larghezza di banda. La differenza si nota maggiormente nell'elaborazione del prompt, dove la versione con 38 core è nettamente più veloce.
È possibile eseguire due LLM in parallelo su un M2 Max 64 GB?+
Sì, se la somma dei pesi e dei contesti rientra nella quota di memoria che Metal assegna alla GPU, cioè tra 43 e 48 GB circa. Ad esempio, un modello da 27B (16 GB) e un modello da 12B (7 GB) trovano entrambi spazio. Ollama mantiene i modelli in memoria per 5 minuti per impostazione predefinita, e un ricaricamento richiede pochi secondi.
Quale modello per il francese su un MacBook Pro M2 Max?+
Mistral Small 3.2 24B, del laboratorio francese Mistral AI, è un buon candidato su 32 GB e oltre (14 GB in Q4). Qwen 3.5 9B e Gemma 4 12B sono multilingui e più veloci. Provali sui tuoi testi: la qualità in francese dipende dal tipo di compito.
Il M2 Max si riscalda di più del M1 Max in inferenza?+
Non abbiamo un confronto numerico affidabile da citare. Entrambi dispongono di raffreddamento attivo; la velocità dipende soprattutto dalla banda passante, identica a 400 GB/s. Per le generazioni lunghe, collega l'alimentazione e prova la modalità Alta potenza proposta da Apple, accettando il rumore delle ventole.
Serve installare MLX insieme a Ollama su un M2 Max?+
Non necessariamente. Ollama basta per la chat, il RAG e l'API. MLX interessa gli sviluppatori che vogliono controllare il modello da Python o provare un fine-tuning LoRA in locale. Le differenze di velocità variano a seconda del modello e della versione: il confronto dettagliato del sito le esamina senza promettere un guadagno fisso.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.