Quale LLM su Mac mini M2 / M2 Pro (8–32 GB) ?
Un Mac mini M2 o M2 Pro può fungere da server LLM domestico silenzioso: con 16 GB di memoria unificata fa girare un modello da 8-9B in Q4, con 32 GB (solo M2 Pro) un modello da 24 a 32B o un MoE da 30-35B. A determinare il comfort d'uso è la banda passante, 100 GB/s su M2 contro 200 GB/s su M2 Pro: a parità di modello, M2 Pro genera quasi due volte più velocemente. Evita la versione da 8 GB.
Il Mac mini M2 di gennaio 2023 è stato sostituito dal M4 alla fine del 2024, ma è ancora molto diffuso sul mercato dell'usato. Questa pagina spiega cosa consente davvero ogni configurazione di memoria, quali prestazioni in token al secondo risultano dalle misurazioni pubblicate, come configurarlo come server Ollama accessibile da tutta la rete locale e quando un modello più recente diventa preferibile.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Mac mini M5 Pro (24 GB / 512 GB).
Perché questa scelta? La nostra scheda completa su Mac mini M5 Pro (24 GB / 512 GB) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Mac mini M2 / M2 Pro nel 2026: ciò che la scheda tecnica promette
Apple ha presentato il Mac mini M2 a gennaio 2023 con «fino a 24 GB di memoria unificata e 100 GB/s di banda passante», e il M2 Pro con 200 GB/s, cioè il doppio, e fino a 32 GB di memoria. Le schede tecniche di Apple indicano le configurazioni di serie e personalizzate: il M2 parte da 8 GB, configurabile con 16 o 24 GB; il M2 Pro parte da 16 GB, configurabile con 32 GB. Non esiste quindi un M2 da 32 GB né un M2 Pro da 8 GB. La memoria è saldata: la scelta si fa all'acquisto, non dopo.
- Mac mini M2
- 8 nuclei CPU, 10 nuclei GPU, 100 GB/s, 8, 16 o 24 GB di memoria unificata.
- Mac mini M2 Pro
- 10 o 12 nuclei CPU, 16 o 19 nuclei GPU, 200 GB/s, 16 o 32 GB.
- Raffreddamento
- Ventilatore attivo: Apple presenta un sistema termico progettato per prestazioni continue, cosa importante per una macchina che risponde a richieste tutto il giorno.
- Consumo
- Secondo la scheda ufficiale di Apple: 7 W a riposo, un massimo di 50 W per il M2 e di 100 W per il M2 Pro. I valori più bassi che si leggono a volte (da 10 a 30 W) sono misurazioni degli utenti, non valori massimi.
#M2 o M2 Pro: la scelta dipende dalla banda passante
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Durante la generazione di testo, ogni token obbliga il chip a rileggere dalla memoria tutti i pesi attivi del modello. La velocità è quindi limitata dalla larghezza di banda divisa per la dimensione del modello. Un M2 a 100 GB/s e un modello da 5 GB danno un limite teorico vicino a 20 token al secondo; il M2 Pro, a 200 GB/s, raddoppia questo limite. La capacità di memoria, invece, determina soltanto cosa può entrarci: un modello da 24B in Q4 (circa 14 GB) non lascia nulla al sistema su una macchina da 16 GB.
| Criterio | Mac mini M2 | Mac mini M2 Pro |
|---|---|---|
| Larghezza di banda | 100 GB/s | 200 GB/s |
| Opzioni di memoria | 8, 16 o 24 GB | 16 o 32 GB |
| Uso più esteso e comodo | 8-9B in Q4 con 16 GB; 12-14B con 24 GB | Da 24B a 32B in Q4 con 32 GB |
| Multiutente, RAG | Uno o due utenti con un utilizzo leggero | Più richieste brevi sono accettabili |
| Consumo massimo (Apple) | 50 W | 100 W |
Il M2 da 24 GB è la configurazione ibrida: ha la capacità necessaria per un modello da 14B, ma mantiene la larghezza di banda del M2. Carica quindi modelli più grandi rispetto al M2 da 16 GB senza farli girare più velocemente. Sceglilo se vuoi una lunga finestra di contesto o due modelli caricati; altrimenti il M2 Pro da 16 GB, due volte più veloce a parità di modello, è spesso migliore per un uso interattivo.
#Quale modello per quale memoria: il calcolo, non la promessa
Non tutto viene caricato nella memoria della GPU. Su Apple Silicon, Metal limita per impostazione predefinita la quota di memoria unificata che la GPU può utilizzare: secondo le discussioni nel repository llama.cpp, è compresa tra due terzi e tre quarti. Su una macchina da 16 GB, considera circa 10-12 GB per il modello e il suo contesto; il resto viene lasciato a macOS. I valori di riferimento del sito per i pesi in Q4 sono 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19-20 GB; a questi si aggiunge la cache del contesto.
| Modello (Q4) | Dimensione del modello | M2 8 GB | M2 16 GB | M2 24 GB / M2 Pro 16 GB | M2 Pro 32 GB |
|---|---|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | Sì | Sì | Sì | Sì |
| Granite 4.2 8B | 4,6 GB | Esatto | Sì | Sì | Sì |
| Qwen 3.5 9B | 6 GB | No | Sì | Sì | Sì |
| Gemma 4 12B | 7 GB | No | Esatto | Sì | Sì |
| Mistral Small 3.2 24B | 14 GB | No | No | No (24 GB: margine molto ridotto) | Sì |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | No | No | No | Sì, margine basso |
Come leggere la tabella: «Al limite» significa che i pesi entrano in memoria, ma il contesto lungo e macOS si contendono quella rimanente. La versione da 8 GB va esclusa per qualsiasi uso serio: macOS e il browser occupano già metà della memoria. Il MoE 35B-A3B è un caso particolare: pesa 21 GB, ma attiva solo circa 3 miliardi di parametri per token, il che lo rende nettamente più veloce di un modello denso delle stesse dimensioni. È il motivo migliore per scegliere un M2 Pro da 32 GB.
#Le velocità misurate: ciò che la fonte pubblicata permette di dire
Non abbiamo misurazioni interne e non ne presentiamo. Il riferimento pubblico più utile è la discussione « Performance of llama.cpp on Apple Silicon M-series » nel repository llama.cpp, dove gli utenti pubblicano i risultati della generazione di testo (tg128) di un modello Llama 7B su ciascun chip Apple. Questi dati si riferiscono alla versione di llama.cpp dell'epoca e a un modello più vecchio di quelli attuali, ma danno un'idea dell'ordine di grandezza.
| Chip | Larghezza di banda | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2, 10 core GPU | 100 GB/s | 21,91 t/s | 12,21 t/s | 6,72 t/s |
| M2 Pro, 16 core GPU | 200 GB/s | 37,87 t/s | 22,70 t/s | 12,47 t/s |
| M2 Pro, 19 core GPU | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
Questo grafico conferma tre cose. Prima di tutto, la velocità dipende dalla dimensione dei pesi: passare da Q4_0 a Q8_0 riduce approssimativamente di un fattore 1,8 il throughput. In secondo luogo, il M2 Pro va circa 1,7 volte più veloce del M2, un po' meno dei 2 volte della banda passante. Terzo, i nuclei GPU aggiuntivi del M2 Pro, con 19 nuclei, non modificano quasi nulla nella generazione (38,86 contro 37,87 t/s): aiutano il trattamento del prompt, non la generazione.
#Il contesto e l’elaborazione del prompt: ciò che rallenta davvero
I token al secondo non dicono tutto. Due dati incidono sull'esperienza: il tempo di elaborazione del prompt (colonna pp512 delle stesse misurazioni: 201 t/s in F16 per l'M2, 384 t/s per l'M2 Pro a 19 core) e la crescita della cache di contesto. Un documento di 20.000 token in ingresso richiede diverse decine di secondi prima della prima parola, su qualsiasi Mac di questa generazione. Per il RAG o l'analisi di documenti, usa estratti brevi anziché incollare un intero PDF.
Anche la cache del contesto occupa memoria: più è lunga la finestra, meno memoria rimane per i pesi. Su 16 GB, ridurre la finestra a 8.000 o 16.000 token lascia spazio a un modello più grande. La guida sulla finestra di contesto spiega nel dettaglio la regola e la guida sulla cache KV spiega come quantizzarla.
#Installare Ollama come server attivo 24/7: la procedura che funziona
Ollama richiede macOS Sonoma (14) o successivo e ascolta per impostazione predefinita su 127.0.0.1, porta 11434: in altre parole, è accessibile solo dalla macchina stessa. Per renderlo accessibile dalle altre postazioni, occorre cambiare l’indirizzo di ascolto. Su Mac, la documentazione ufficiale della FAQ indica che, quando Ollama viene eseguito come applicazione, le variabili d’ambiente si impostano con launchctl, dopodiché l’applicazione deve essere riavviata.
- 01Installare l'applicazione OllamaScarica l'applicazione dal sito ufficiale o usa Homebrew; la guida all'installazione su macOS descrive in dettaglio entrambe le opzioni. Non usare contemporaneamente l'applicazione e un servizio Homebrew: entrambi cercano di usare la stessa porta.
- 02Definire l'indirizzo di ascoltoEsegui launchctl setenv OLLAMA_HOST 0.0.0.0:11434 nel Terminale, poi chiudi e riavvia l'applicazione Ollama.
- 03Impedire la sospensioneNelle Impostazioni di Sistema, nella sezione Risparmio Energia, attiva l'opzione che impedisce lo stop automatico quando lo schermo è spento e attiva il login automatico se il Mac deve riavviarsi da solo.
- 04Riservare un indirizzo fissoAssegna un indirizzo IP fisso al Mac mini nel tuo router, oppure usa il suo nome mac-mini.local sulla rete locale.
- 05Precaricare il modelloScarica il modello con ollama pull, poi prova da un altro computer con il comando curl riportato di seguito.
#Cosa mette a disposizione il Mac mini per tutta la casa
Il Mac mini M2 non è un server di produzione, ma è eccellente per tre usi: una chat per la famiglia, un'API compatibile con OpenAI per i tuoi strumenti e automazioni leggere. Ollama supporta un sottoinsieme dell'API OpenAI sulla stessa porta, il che permette di collegare molti client esistenti cambiando soltanto l'indirizzo; verifica che le funzioni di cui hai bisogno (strumenti, output strutturati) siano supportate.
- Chat
- Open WebUI o un'app mobile compatibile con Ollama: inserisci l'indirizzo http://mac-mini.local:11434 nelle impostazioni.
- Codice
- Continue, Aider o Zed: indica l'URL del server Ollama come provider.
- Automazione
- n8n, Home Assistant o Comandi Rapidi di iOS: possono chiamare un'API HTTP compatibile con OpenAI.
- Indicizzazione dei documenti
- Un modello di embedding leggero, come nomic-embed-text, lascia spazio a un modello di chat da 8-9B su 16 GB.
Un limite da conoscere: Ollama elabora per impostazione predefinita una richiesta alla volta per modello (OLLAMA_NUM_PARALLEL vale 1). Due persone che pongono una domanda contemporaneamente si dividono quindi la capacità di elaborazione o attendono il proprio turno. Per una famiglia è sufficiente; per un team con più di tre o quattro persone attive, è preferibile una macchina più potente o un server di inferenza progettato per il parallelismo.
#Mac mini M2 o un computer più recente: quando cambiare
Il M4 di base sale a 120 GB/s (valore della tabella llama.cpp) e il M4 Pro a 273 GB/s, secondo Apple; poiché la larghezza di banda è il fattore limitante, la differenza di velocità è di circa il 20% tra M2 e M4 di base, e molto maggiore tra M2 Pro e M4 Pro. Il M2 Pro da 32 GB usato resta una scelta pertinente se punti a un modello da 24 a 32B; per attività con agenti IA o programmazione su contesti lunghi, un chip recente con più memoria rende l'utilizzo più confortevole.
| Situazione | Raccomandazione |
|---|---|
| Chat familiare 8-9B, budget limitato | Un Mac mini M2 usato con 16 GB è sufficiente |
| Modello da 24 a 32B o MoE da 30-35B | M2 Pro 32 GB, oppure un Mac più recente con 32 GB e oltre |
| Contesti lunghi, agenti, più utenti | Un Mac mini M4 Pro o successivo |
| Servono 64 GB o più | Mac Studio, mai un M2 mini |
- Mac mini M4 / M4 Pro: il successore
- Scheda hardware: Mac mini M4 Pro
- Impostazioni macOS per Apple Silicon
- Installare Ollama su macOS
- Fonte: Apple, scheda tecnica del Mac mini (2023)
- Fonte: Apple, consumo e dissipazione termica del Mac mini
- Fonte: misurazioni con llama.cpp su chip Apple
- Fonte: FAQ ufficiale di Ollama
#Domande frequenti
Il Mac mini M2 può funzionare 24 ore su 24 come server LLM?+
Quale Mac mini M2 scegliere di seconda mano per l'IA locale?+
Quanti token al secondo fa un Mac mini M2?+
È possibile usare il Mac mini M2 da un iPhone o da un altro computer?+
Il Mac mini M2 è più veloce di un MacBook Air M2?+
È possibile affinare un modello su un Mac mini M2 Pro?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.