Principiante 12 minMac mini

Quale LLM su Mac mini M2 / M2 Pro (8–32 GB) ?

Risposta diretta

Un Mac mini M2 o M2 Pro può fungere da server LLM domestico silenzioso: con 16 GB di memoria unificata fa girare un modello da 8-9B in Q4, con 32 GB (solo M2 Pro) un modello da 24 a 32B o un MoE da 30-35B. A determinare il comfort d'uso è la banda passante, 100 GB/s su M2 contro 200 GB/s su M2 Pro: a parità di modello, M2 Pro genera quasi due volte più velocemente. Evita la versione da 8 GB.

Il Mac mini M2 di gennaio 2023 è stato sostituito dal M4 alla fine del 2024, ma è ancora molto diffuso sul mercato dell'usato. Questa pagina spiega cosa consente davvero ogni configurazione di memoria, quali prestazioni in token al secondo risultano dalle misurazioni pubblicate, come configurarlo come server Ollama accessibile da tutta la rete locale e quando un modello più recente diventa preferibile.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: Mac mini M5 Pro (24 GB / 512 GB).

Perché questa scelta? La nostra scheda completa su Mac mini M5 Pro (24 GB / 512 GB) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#Mac mini M2 / M2 Pro nel 2026: ciò che la scheda tecnica promette

Apple ha presentato il Mac mini M2 a gennaio 2023 con «fino a 24 GB di memoria unificata e 100 GB/s di banda passante», e il M2 Pro con 200 GB/s, cioè il doppio, e fino a 32 GB di memoria. Le schede tecniche di Apple indicano le configurazioni di serie e personalizzate: il M2 parte da 8 GB, configurabile con 16 o 24 GB; il M2 Pro parte da 16 GB, configurabile con 32 GB. Non esiste quindi un M2 da 32 GB né un M2 Pro da 8 GB. La memoria è saldata: la scelta si fa all'acquisto, non dopo.

Mac mini M2
8 nuclei CPU, 10 nuclei GPU, 100 GB/s, 8, 16 o 24 GB di memoria unificata.
Mac mini M2 Pro
10 o 12 nuclei CPU, 16 o 19 nuclei GPU, 200 GB/s, 16 o 32 GB.
Raffreddamento
Ventilatore attivo: Apple presenta un sistema termico progettato per prestazioni continue, cosa importante per una macchina che risponde a richieste tutto il giorno.
Consumo
Secondo la scheda ufficiale di Apple: 7 W a riposo, un massimo di 50 W per il M2 e di 100 W per il M2 Pro. I valori più bassi che si leggono a volte (da 10 a 30 W) sono misurazioni degli utenti, non valori massimi.
i
Perché il M2 resta credibile come server
Il vantaggio principale non è la velocità pura, ma la combinazione di rumore, ingombro e consumo a riposo: 7 W a vuoto secondo Apple. Una macchina che risponde dieci minuti al giorno e dorme per il resto del tempo costa molto poco da far funzionare. Per la velocità, bisogna guardare la larghezza di banda.

#M2 o M2 Pro: la scelta dipende dalla banda passante

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Durante la generazione di testo, ogni token obbliga il chip a rileggere dalla memoria tutti i pesi attivi del modello. La velocità è quindi limitata dalla larghezza di banda divisa per la dimensione del modello. Un M2 a 100 GB/s e un modello da 5 GB danno un limite teorico vicino a 20 token al secondo; il M2 Pro, a 200 GB/s, raddoppia questo limite. La capacità di memoria, invece, determina soltanto cosa può entrarci: un modello da 24B in Q4 (circa 14 GB) non lascia nulla al sistema su una macchina da 16 GB.

M2 o M2 Pro per un server LLM
CriterioMac mini M2Mac mini M2 Pro
Larghezza di banda100 GB/s200 GB/s
Opzioni di memoria8, 16 o 24 GB16 o 32 GB
Uso più esteso e comodo8-9B in Q4 con 16 GB; 12-14B con 24 GBDa 24B a 32B in Q4 con 32 GB
Multiutente, RAGUno o due utenti con un utilizzo leggeroPiù richieste brevi sono accettabili
Consumo massimo (Apple)50 W100 W

Il M2 da 24 GB è la configurazione ibrida: ha la capacità necessaria per un modello da 14B, ma mantiene la larghezza di banda del M2. Carica quindi modelli più grandi rispetto al M2 da 16 GB senza farli girare più velocemente. Sceglilo se vuoi una lunga finestra di contesto o due modelli caricati; altrimenti il M2 Pro da 16 GB, due volte più veloce a parità di modello, è spesso migliore per un uso interattivo.

#Quale modello per quale memoria: il calcolo, non la promessa

Non tutto viene caricato nella memoria della GPU. Su Apple Silicon, Metal limita per impostazione predefinita la quota di memoria unificata che la GPU può utilizzare: secondo le discussioni nel repository llama.cpp, è compresa tra due terzi e tre quarti. Su una macchina da 16 GB, considera circa 10-12 GB per il modello e il suo contesto; il resto viene lasciato a macOS. I valori di riferimento del sito per i pesi in Q4 sono 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19-20 GB; a questi si aggiunge la cache del contesto.

Cosa entra in memoria in base alla capacità disponibile (pesi in Q4 dal catalogo QuelLLM, escluso il contesto)
Modello (Q4)Dimensione del modelloM2 8 GBM2 16 GBM2 24 GB / M2 Pro 16 GBM2 Pro 32 GB
Qwen 3.5 4B2,3 GBSìSìSìSì
Granite 4.2 8B4,6 GBEsattoSìSìSì
Qwen 3.5 9B6 GBNoSìSìSì
Gemma 4 12B7 GBNoEsattoSìSì
Mistral Small 3.2 24B14 GBNoNoNo (24 GB: margine molto ridotto)Sì
Qwen 3.6 35B-A3B (MoE)21 GBNoNoNoSì, margine basso

Come leggere la tabella: «Al limite» significa che i pesi entrano in memoria, ma il contesto lungo e macOS si contendono quella rimanente. La versione da 8 GB va esclusa per qualsiasi uso serio: macOS e il browser occupano già metà della memoria. Il MoE 35B-A3B è un caso particolare: pesa 21 GB, ma attiva solo circa 3 miliardi di parametri per token, il che lo rende nettamente più veloce di un modello denso delle stesse dimensioni. È il motivo migliore per scegliere un M2 Pro da 32 GB.

#Le velocità misurate: ciò che la fonte pubblicata permette di dire

Non abbiamo misurazioni interne e non ne presentiamo. Il riferimento pubblico più utile è la discussione « Performance of llama.cpp on Apple Silicon M-series » nel repository llama.cpp, dove gli utenti pubblicano i risultati della generazione di testo (tg128) di un modello Llama 7B su ciascun chip Apple. Questi dati si riferiscono alla versione di llama.cpp dell'epoca e a un modello più vecchio di quelli attuali, ma danno un'idea dell'ordine di grandezza.

Generazione di testo, Llama 7B, llama.cpp (discussione #4167)
ChipLarghezza di bandaQ4_0Q8_0F16
M2, 10 core GPU100 GB/s21,91 t/s12,21 t/s6,72 t/s
M2 Pro, 16 core GPU200 GB/s37,87 t/s22,70 t/s12,47 t/s
M2 Pro, 19 core GPU200 GB/s38,86 t/s23,01 t/s13,06 t/s

Questo grafico conferma tre cose. Prima di tutto, la velocità dipende dalla dimensione dei pesi: passare da Q4_0 a Q8_0 riduce approssimativamente di un fattore 1,8 il throughput. In secondo luogo, il M2 Pro va circa 1,7 volte più veloce del M2, un po' meno dei 2 volte della banda passante. Terzo, i nuclei GPU aggiuntivi del M2 Pro, con 19 nuclei, non modificano quasi nulla nella generazione (38,86 contro 37,87 t/s): aiutano il trattamento del prompt, non la generazione.

→
Il calcolo da rifare da solo
Per un M2 a 100 GB/s e un file da 3,8 GB, il limite teorico è vicino a 26 t/s; la misura sopra indicata (21,91 t/s) ne rappresenta circa l'84%. Per un modello 9B in Q4 di circa 6 GB, lo stesso calcolo dà un limite vicino a 16 t/s su M2 e a 33 t/s su M2 Pro, prima delle perdite. Si tratta di limiti teorici ricavati da misure pubblicate, non di velocità garantite.

#Il contesto e l’elaborazione del prompt: ciò che rallenta davvero

I token al secondo non dicono tutto. Due dati incidono sull'esperienza: il tempo di elaborazione del prompt (colonna pp512 delle stesse misurazioni: 201 t/s in F16 per l'M2, 384 t/s per l'M2 Pro a 19 core) e la crescita della cache di contesto. Un documento di 20.000 token in ingresso richiede diverse decine di secondi prima della prima parola, su qualsiasi Mac di questa generazione. Per il RAG o l'analisi di documenti, usa estratti brevi anziché incollare un intero PDF.

Anche la cache del contesto occupa memoria: più è lunga la finestra, meno memoria rimane per i pesi. Su 16 GB, ridurre la finestra a 8.000 o 16.000 token lascia spazio a un modello più grande. La guida sulla finestra di contesto spiega nel dettaglio la regola e la guida sulla cache KV spiega come quantizzarla.

#Installare Ollama come server attivo 24/7: la procedura che funziona

Ollama richiede macOS Sonoma (14) o successivo e ascolta per impostazione predefinita su 127.0.0.1, porta 11434: in altre parole, è accessibile solo dalla macchina stessa. Per renderlo accessibile dalle altre postazioni, occorre cambiare l’indirizzo di ascolto. Su Mac, la documentazione ufficiale della FAQ indica che, quando Ollama viene eseguito come applicazione, le variabili d’ambiente si impostano con launchctl, dopodiché l’applicazione deve essere riavviata.

  1. 01
    Installare l'applicazione Ollama
    Scarica l'applicazione dal sito ufficiale o usa Homebrew; la guida all'installazione su macOS descrive in dettaglio entrambe le opzioni. Non usare contemporaneamente l'applicazione e un servizio Homebrew: entrambi cercano di usare la stessa porta.
  2. 02
    Definire l'indirizzo di ascolto
    Esegui launchctl setenv OLLAMA_HOST 0.0.0.0:11434 nel Terminale, poi chiudi e riavvia l'applicazione Ollama.
  3. 03
    Impedire la sospensione
    Nelle Impostazioni di Sistema, nella sezione Risparmio Energia, attiva l'opzione che impedisce lo stop automatico quando lo schermo è spento e attiva il login automatico se il Mac deve riavviarsi da solo.
  4. 04
    Riservare un indirizzo fisso
    Assegna un indirizzo IP fisso al Mac mini nel tuo router, oppure usa il suo nome mac-mini.local sulla rete locale.
  5. 05
    Precaricare il modello
    Scarica il modello con ollama pull, poi prova da un altro computer con il comando curl riportato di seguito.
Configurazione e test
# Sur le Mac mini
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
# quitter puis relancer l'application Ollama
ollama pull qwen3:8b

# Depuis un autre poste du réseau local
curl http://mac-mini.local:11434/api/chat -d '{"model":"qwen3:8b","stream":false,"messages":[{"role":"user","content":"Bonjour"}]}'
!
Esporre l'API: una decisione di sicurezza
Ollama non prevede autenticazione. Restare in ascolto su 0.0.0.0 è adatto a una rete domestica fidata; per qualsiasi accesso dall'esterno, non configurare mai l'inoltro della porta 11434 sul tuo router. Usa una VPN o un reverse proxy con autenticazione. Per impostazione predefinita, un modello rimane in memoria per 5 minuti dopo l'ultima richiesta: imposta OLLAMA_KEEP_ALIVE se la prima chiamata della giornata ti sembra lenta.

#Cosa mette a disposizione il Mac mini per tutta la casa

Il Mac mini M2 non è un server di produzione, ma è eccellente per tre usi: una chat per la famiglia, un'API compatibile con OpenAI per i tuoi strumenti e automazioni leggere. Ollama supporta un sottoinsieme dell'API OpenAI sulla stessa porta, il che permette di collegare molti client esistenti cambiando soltanto l'indirizzo; verifica che le funzioni di cui hai bisogno (strumenti, output strutturati) siano supportate.

Chat
Open WebUI o un'app mobile compatibile con Ollama: inserisci l'indirizzo http://mac-mini.local:11434 nelle impostazioni.
Codice
Continue, Aider o Zed: indica l'URL del server Ollama come provider.
Automazione
n8n, Home Assistant o Comandi Rapidi di iOS: possono chiamare un'API HTTP compatibile con OpenAI.
Indicizzazione dei documenti
Un modello di embedding leggero, come nomic-embed-text, lascia spazio a un modello di chat da 8-9B su 16 GB.

Un limite da conoscere: Ollama elabora per impostazione predefinita una richiesta alla volta per modello (OLLAMA_NUM_PARALLEL vale 1). Due persone che pongono una domanda contemporaneamente si dividono quindi la capacità di elaborazione o attendono il proprio turno. Per una famiglia è sufficiente; per un team con più di tre o quattro persone attive, è preferibile una macchina più potente o un server di inferenza progettato per il parallelismo.

#Mac mini M2 o un computer più recente: quando cambiare

Il M4 di base sale a 120 GB/s (valore della tabella llama.cpp) e il M4 Pro a 273 GB/s, secondo Apple; poiché la larghezza di banda è il fattore limitante, la differenza di velocità è di circa il 20% tra M2 e M4 di base, e molto maggiore tra M2 Pro e M4 Pro. Il M2 Pro da 32 GB usato resta una scelta pertinente se punti a un modello da 24 a 32B; per attività con agenti IA o programmazione su contesti lunghi, un chip recente con più memoria rende l'utilizzo più confortevole.

Quando restare su M2, quando cambiare
SituazioneRaccomandazione
Chat familiare 8-9B, budget limitatoUn Mac mini M2 usato con 16 GB è sufficiente
Modello da 24 a 32B o MoE da 30-35BM2 Pro 32 GB, oppure un Mac più recente con 32 GB e oltre
Contesti lunghi, agenti, più utentiUn Mac mini M4 Pro o successivo
Servono 64 GB o piùMac Studio, mai un M2 mini

#Domande frequenti

FAQ
Il Mac mini M2 può funzionare 24 ore su 24 come server LLM?+
Sì, è progettato per rimanere acceso: Apple indica un consumo di 7 W a riposo e una ventola attiva per sostenere carichi prolungati. L'impostazione da modificare è quella che impedisce la sospensione automatica. Durante l'inferenza intensiva, il consumo aumenta, ma Apple indica un massimo di 50 W per il M2 e di 100 W per il M2 Pro.
Quale Mac mini M2 scegliere di seconda mano per l'IA locale?+
Il M2 Pro 32 GB per puntare a modelli da 24 a 32B o a un MoE da 30 a 35B, il M2 16 GB per modelli da 8 a 9B al prezzo migliore. Evita la versione da 8 GB: macOS ne consuma già la metà. Poiché la memoria è saldata, verifica la configurazione esatta in «Informazioni su questo Mac» prima dell'acquisto.
Quanti token al secondo fa un Mac mini M2?+
Le misurazioni pubblicate nel repository llama.cpp indicano 21,9 t/s su M2 e da 37,9 a 38,9 t/s su M2 Pro, per un Llama 7B in Q4_0. Per un modello 9B in Q4, aspettati valori inferiori. Sono misurazioni effettuate dagli utenti, da prendere come un ordine di grandezza.
È possibile usare il Mac mini M2 da un iPhone o da un altro computer?+
Sì. Una volta impostato OLLAMA_HOST su 0.0.0.0:11434, qualsiasi client della rete locale compatibile con Ollama o OpenAI può connettersi, comprese le app iOS che richiedono l'indirizzo del server. Tuttavia, non esporlo su Internet senza una VPN o un reverse proxy con autenticazione, poiché l'API di Ollama non offre alcuna autenticazione.
Il Mac mini M2 è più veloce di un MacBook Air M2?+
A parità di chip, la larghezza di banda è la stessa, quindi le velocità di picco sono simili. Il vantaggio del Mac mini è la ventola attiva: regge il carico senza ridurre la frequenza, mentre un MacBook Air senza ventola finisce per rallentare durante le generazioni lunghe.
È possibile affinare un modello su un Mac mini M2 Pro?+
Per un modello piccolo, un fine-tuning LoRA tramite MLX è possibile, ma lento: considera diverse ore a seconda delle dimensioni del dataset. Un fine-tuning completo non è praticabile con 32 GB di memoria condivisa con macOS. La scelta più ragionevole è usare il Mac mini per l'inferenza e noleggiare una GPU occasionalmente per l'addestramento.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.