Quale LLM su MacBook Pro M2 Pro / Max (16–96 GB) ?
Un MacBook Pro M2 Pro gestisce senza problemi un modello da 8-9B con 16 GB e uno da 24 a 32B con 32 GB; un M2 Max con 64 o 96 GB è l'unica variante di questa generazione a ospitare un 70B in Q4 (circa 40 GB) e due modelli da 20 a 30B contemporaneamente. La velocità dipende dalla banda passante: 200 GB/s per il M2 Pro, 400 GB/s per il M2 Max, cioè quasi il doppio dei token al secondo a parità di modello.
Uscito nel gennaio 2023, il MacBook Pro M2 Pro / Max resta uno dei portatili più potenti per l'IA locale: ventilatori, 400 GB/s di banda passante sul M2 Max e fino a 96 GB di memoria unificata. Questa pagina spiega cosa permette ogni configurazione di memoria, cosa dicono le misurazioni pubblicate, perché raddoppiare la banda passante non raddoppia la velocità, e in quali casi vale la pena passare a un M4 Max.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#MacBook Pro M2 Pro / Max nel 2026: la scheda tecnica utile
Alla presentazione, Apple annunciava per il M2 Pro una banda passante di 200 GB/s e fino a 32 GB di memoria unificata, e per il M2 Max 400 GB/s, fino a 96 GB e una GPU con un massimo di 38 core. Apple presentava questi 96 GB come un modo per superare i limiti della memoria grafica su un portatile. La memoria è saldata al processore, quindi scegli la configurazione all'acquisto e non puoi più modificarla.
| Chip | Larghezza di banda | Opzioni di memoria | GPU |
|---|---|---|---|
| M2 Pro | 200 GB/s | 16 o 32 GB | 16 o 19 core |
| M2 Max | 400 GB/s | 32, 64 o 96 GB | 30 o 38 core |
Il raffreddamento attivo è il secondo vantaggio rispetto a un MacBook Air: il MacBook Pro può sostenere carichi prolungati senza che il chip debba rallentare in modo marcato. Apple offre anche, su alcuni modelli, una modalità Alta potenza che permette alle ventole di girare più velocemente; è un'impostazione da provare per le generazioni prolungate, al prezzo di un maggiore rumore.
#M2 Pro o M2 Max: cosa cambia davvero con la banda passante
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La generazione di testo legge a ogni token l'intero insieme dei pesi attivi del modello. La velocità massima è quindi la banda passante divisa per la dimensione dei pesi. Un M2 Max a 400 GB/s potrebbe, in teoria, essere due volte più veloce di un M2 Pro a 200 GB/s. I dati pubblicati nel repository llama.cpp mostrano che ciò avviene solo in parte.
| Chip (core GPU) | Larghezza di banda | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2 Pro (19) | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
| M2 Max (30) | 400 GB/s | 60,99 t/s | 39,97 t/s | 24,16 t/s |
| M2 Max (38) | 400 GB/s | 65,95 t/s | 41,83 t/s | 24,65 t/s |
Su un modello da 7B in Q4_0, l'M2 Max è solo da 1,6 a 1,7 volte più veloce dell'M2 Pro. Sullo stesso modello in F16, da circa 13 GB, il rapporto sale a quasi 1,9. Il calcolo lo spiega: un modello piccolo viene letto così rapidamente che altri limiti (calcolo, latenza, overhead) tornano a prevalere, mentre un modello grande satura davvero la memoria. La conseguenza pratica è controintuitiva: più il modello è grande, più l'M2 Max giustifica il suo prezzo. Per un 7B, un M2 Pro è più che sufficiente.
#Da 16 a 96 GB: ciò che entra in memoria e ciò che ci sta a malapena
Su Apple Silicon, la GPU non ha accesso a tutta la memoria per impostazione predefinita: secondo le discussioni nel repository llama.cpp, Metal ne concede tra i due terzi e i tre quarti. Su 16 GB, considera circa 10–12 GB per il modello e il suo contesto; su 96 GB, circa 64–72 GB. Il limite può essere aumentato tramite un'impostazione di sistema descritta in dettaglio nella guida dedicata, ma superarlo può bloccare la macchina.
| Modello | Pesi Q4 | M2 Pro 16 GB | M2 Pro 32 GB | M2 Max 64 GB | M2 Max 96 GB |
|---|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | Comodo | Sì | Sì | Sì |
| Gemma 4 12B | 7 GB | Esatto | Sì | Sì | Sì |
| Mistral Small 3.2 24B | 14 GB | No | Sì | Sì | Sì |
| Qwen 3.5 27B | 16 GB | No | Sì, contesto moderato | Sì | Sì |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | No | Sì, contesto moderato | Sì | Sì |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | No | Esatto | Sì | Sì |
| Llama 3.3 70B | 40 GB | No | No | Sì, contesto breve | Sì |
I modelli MoE come Qwen3-Coder 30B-A3B o Qwen 3.6 35B-A3B pesano 19 e 21 GB, ma attivano solo circa 3 miliardi di parametri per token: a parità di memoria, generano nettamente più velocemente di un modello denso da 27B. È l’opzione più conveniente con 32 GB. Con 96 GB, il vantaggio del M2 Max consiste più nel mantenere due modelli contemporaneamente in memoria che nel caricare un unico modello molto grande, ad esempio un modello per la chat e uno per la programmazione.
#Velocità pubblicate: ciò che si può affermare e ciò che non si può affermare
Non abbiamo misurazioni nostre su questa macchina e i token al secondo dipendono dal modello, dalla quantizzazione, dal contesto e dalla versione di llama.cpp o di Ollama. Le uniche misurazioni che citiamo sono quelle pubblicate da utenti su un Llama 7B, che danno un ordine di grandezza. Per un modello più recente, il calcolo della larghezza di banda divisa per il peso rimane il riferimento da usare, con il margine di errore indicato più sopra.
L'elaborazione del prompt segue un'altra logica: la tabella di llama.cpp indica, per lo stesso Llama 7B in F16, 384 t/s nell'elaborazione del prompt su un M2 Pro a 19 core e 756 t/s su un M2 Max a 38 core. Il numero di core GPU influisce su questa fase, non sulla generazione. Per un RAG o l'analisi di un documento lungo, un M2 Max richiederà quindi circa la metà del tempo di attesa prima della prima parola rispetto a un M2 Pro.
#Installare Ollama e utilizzarlo correttamente su Mac
Ollama richiede macOS Sonoma (14) o successivo. Su Mac, la FAQ ufficiale precisa che, quando Ollama viene eseguito come applicazione, le sue variabili d'ambiente si impostano con launchctl, poi l'applicazione deve essere riavviata. Esportare le variabili in un terminale non basta: l'applicazione non le vede.
La FAQ di Ollama indica che la cache K/V quantizzata in q8_0 utilizza circa la metà della memoria del formato f16 predefinito e che Flash Attention deve essere attivo per sfruttarla. Su un 70B con un contesto lungo, è questa impostazione che permette alla cache di rientrare nella memoria disponibile. Un limite da conoscere: la quantizzazione della cache può ridurre leggermente la qualità su alcuni modelli; provala sui tuoi casi d'uso prima di mantenerla.
#Quale modello per quale uso
- Chat generale
- Un modello da 8 a 12B (Qwen 3.5 9B, Gemma 4 12B) risponde velocemente su M2 Pro; un modello da 27B diventa interessante a partire da 32 GB per un francese più curato.
- Codice
- Un modello MoE di codice come Qwen3-Coder 30B-A3B su 32 GB o più, oppure un modello di agente di codice da 24B come Devstral Small 2 (14 GB in Q4). Per l'autocompletamento online, un modello da 7B basta.
- RAG documentale
- Gemma 4 12B per la velocità, un 24B per la qualità del ragionamento; limita il contesto per non prolungare l'attesa prima della prima parola.
- Analisi lunghe, agenti
- Con 64 GB o più: Qwen 3.6 35B-A3B come MoE veloce, oppure un 70B per la qualità, a condizione di accettare circa 10 t/s nel migliore dei casi (400 ÷ 40).
Un aspetto a cui prestare attenzione nei modelli di ragionamento: producono lunghi blocchi di riflessione prima della risposta, moltiplicando il numero di token da generare. Su una macchina a 60 t/s, diecimila token di riflessione richiedono quasi tre minuti. Per le domande semplici, disattiva la modalità di riflessione quando il modello lo permette.
#A batteria, sotto carico prolungato: cosa cambia
Il MacBook Pro è progettato per sostenere il carico più a lungo di un Air, ma resta un portatile. Due impostazioni influiscono sulla velocità di elaborazione: la modalità di alimentazione (quando funziona a batteria, macOS può limitare la potenza) e, sui modelli che la offrono, la modalità ad alta potenza. Secondo Apple, questa modalità permette alle ventole di girare più velocemente per mantenere prestazioni migliori con carichi molto intensi, producendo più rumore. Per una generazione di diversi minuti, collega l'alimentazione e prova questa modalità.
#Conviene passare a un M4 Max?
Il M4 Max raggiunge 546 GB/s e 128 GB di memoria secondo Apple. Nella tabella di llama.cpp, un Llama 7B in Q4_0 passa da 65,95 t/s sul M2 Max 38 core a 83,06 t/s sul M4 Max 40 core: circa il 26% in più. Il vantaggio è reale per un uso intenso, ma il M2 Max 96 GB mantiene un vantaggio di capacità rispetto a un M4 Pro, limitato a 64 GB.
| Situazione | Raccomandazione |
|---|---|
| Usi principalmente modelli da 8 a 14B | Un M2 Pro con 32 GB basta; non pagare di più per la maggiore larghezza di banda |
| Carichi modelli da 27 a 35B ogni giorno | M2 Max con 64 o 96 GB: è qui che ha senso |
| Vuoi eseguire comodamente un 70B o mantenere due modelli residenti in memoria | M2 Max 96 GB, oppure M4 Max 128 GB se la velocità conta |
| Cerchi un server senza schermo | Un Mac mini M4 Pro o un Mac Studio è più adatto |
- MacBook Pro M3
- MacBook Pro M4
- Mac Studio per configurazioni da 64 a 512 GB
- Scheda hardware: MacBook Pro M4 Max
- Fonte: misurazioni con llama.cpp su chip Apple
- Fonte: Apple, lancio del MacBook Pro M2 Pro e M2 Max
- Fonte: FAQ ufficiale di Ollama
#Domande frequenti
Un MacBook Pro M2 Pro 16 GB è sufficiente per l'IA locale?+
Qual è la differenza tra M2 Max con 30 e 38 core GPU?+
È possibile eseguire due LLM in parallelo su un M2 Max 64 GB?+
Quale modello per il francese su un MacBook Pro M2 Max?+
Il M2 Max si riscalda di più del M1 Max in inferenza?+
Serve installare MLX insieme a Ollama su un M2 Max?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.