Quale LLM su Mac mini M4 / M4 Pro (16–64 GB) ?
Un Mac mini M4 fa funzionare correttamente un LLM locale già con 16 GB: modelli da 7 a 12 miliardi di parametri, a circa venti token/s nel migliore dei casi su un 7B in Q4_0, perché la sua banda passante di 120 GB/s limita la velocità. Per puntare a modelli da 14 a 35 miliardi di parametri, serve un M4 Pro (273 GB/s, da 24 a 64 GB). Apple ha sostituito questa gamma nell'agosto 2026 con i Mac mini M6 e M5 Pro.
Questa guida usa i dati di Apple, di llama.cpp e della documentazione di Ollama e LM Studio per aiutarti a decidere: quale chip, quale memoria, quale modello e quale velocità aspettarti. Distingue ciò che Apple annuncia, ciò che la comunità ha misurato e ciò che è soltanto un calcolo, e fa il punto sulla gamma M6 e M5 Pro uscita a settembre 2026.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Mac mini M5 Pro (24 GB / 512 GB).
Perché questa scelta? La nostra scheda completa su Mac mini M5 Pro (24 GB / 512 GB) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Mac mini M4 e LLM locale: cosa la macchina sa fare
Un Mac mini è un buon server per LLM locali perché la sua memoria unificata è condivisa tra il processore e la GPU, senza VRAM separata. Due numeri determinano cosa puoi farne. La capacità (da 16 a 64 GB a seconda del chip) determina la dimensione del modello che può essere caricato: da 7 a 12 miliardi di parametri con 16 GB, da 24 a 35 miliardi con 32–48 GB. La banda passante determina la velocità: 120 GB/s per il chip M4, 273 GB/s per l'M4 Pro, secondo Apple. Un LLM rilegge i suoi pesi a ogni token prodotto, quindi la velocità massima è approssimativamente pari alla banda passante divisa per la dimensione dei pesi. Per un modello 7B in Q4_0, la tabella pubblica di llama.cpp riporta 24,1 token/s per un M4 e circa 50 per un M4 Pro. Apple ha presentato nell'agosto 2026 i Mac mini M6 e M5 Pro che sostituiscono questa gamma; l'M4 era ancora disponibile presso alcuni rivenditori a fine agosto.
- Mac mini M4
- CPU a 10 core, GPU a 10 core, 120 GB/s, 16 GB di memoria unificata (24 o 32 GB opzionali), Thunderbolt 4.
- Mac mini M4 Pro
- CPU a 12 core, GPU a 16 core (14 e 20 come opzioni), 273 GB/s, 24 GB di memoria (48 o 64 GB come opzioni), Thunderbolt 5.
- Dimensioni e rumorosità
- 12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) o 0,73 kg (M4 Pro); 5 dBA a riposo, secondo Apple.
- Consumo annunciato
- M4: 4 W a riposo, 65 W al massimo. M4 Pro: 5 W e 140 W. Apple non pubblica valori durante l'inferenza.
#Mac mini M4 o M4 Pro: la banda passante è decisiva
Sai quale modello rientra nella memoria del tuo Mac mini M4. Il kit Mac ti insegna a sfruttarlo al massimo: aumentare il limite di memoria della GPU (cap. 2), scegliere tra MLX e GGUF (cap. 3) e trasformare il tuo Mac mini in un server IA per tutta la casa (cap. 12).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Tra i due chip, la vera differenza non è la memoria massima (32 GB contro 64 GB), ma la larghezza di banda, moltiplicata per 2,3 (273 ÷ 120). Nella tabella di llama.cpp, il rapporto misurato è di 2,1 nella generazione (50,7 ÷ 24,1 in Q4_0) e di 2,0 nella lettura del prompt (440 ÷ 221).
| Criterio | Mac mini M4 | Mac mini M4 Pro |
|---|---|---|
| Banda passante della memoria (Apple) | 120 GB/s | 273 GB/s |
| Memoria unificata (Apple) | 16 GB, opzione 24 o 32 GB | 24 GB, opzione 48 o 64 GB |
| Generazione, Llama 2 7B in Q4_0 (llama.cpp) | 24,1 token/s | 50,7 token/s (GPU a 20 core) |
| Generazione, stesso modello in Q8_0 | 13,5 token/s | 30,7 token/s |
| Lettura del prompt, Q4_0 | 221 token/s | 440 token/s |
| Porte Thunderbolt (Apple) | Thunderbolt 4, 40 Gb/s | Thunderbolt 5, 120 Gb/s |
- Il M4 basta se
- sei solo, punti a modelli fino a 12 miliardi di parametri (Qwen 3.5 9B, Gemma 4 12B) e accetti una ventina di token/s nel migliore dei casi. Scegli 24 GB per tenere caricato anche un modello di embedding.
- L'M4 Pro è la scelta obbligata se
- punti a modelli da 14 a 27 miliardi di parametri, a un MoE da 30 a 35 miliardi (almeno 48 GB), a un agente di programmazione o all'uso da parte di più utenti. Oltre 64 GB, serve un Mac Studio.
#VRAM su Mac mini: la memoria unificata e il limite utilizzabile dalla GPU
Un Mac mini non ha VRAM separata, ma la GPU non può utilizzare tutta la memoria. Secondo gli utenti di llama.cpp, il limite predefinito va da due terzi a tre quarti della RAM; all'avvio, llama.cpp mostra la riga recommendedMaxWorkingSetSize, che indica il valore effettivo. Il parametro iogpu.wired_limit_mb vale 0 per default, il che significa «politica predefinita del sistema» e non «illimitato».
| Memoria del Mac mini | Limite GPU stimato | Memoria rimanente per macOS |
|---|---|---|
| 16 GB | Da 10,7 a 12 GB | Da 4 a 5 GB |
| 24 GB | Da 16 a 18 GB | Da 6 a 8 GB |
| 32 GB | Da 21 a 24 GB | Da 8 a 11 GB |
| 48 GB | Da 32 a 36 GB | Da 12 a 16 GB |
| 64 GB | Da 43 a 48 GB | 16–21 GB |
Il limite di memoria deve essere sufficiente per i pesi, la cache KV (la memoria del contesto, che cresce con la conversazione) e i buffer di calcolo. Per caricare un modello che sfiora il limite, si aumenta questa soglia: MLX consiglia un valore superiore alla dimensione del modello in megabyte, ma inferiore alla memoria della macchina. Lascia diversi gigabyte a macOS, altrimenti la velocità crolla. Un'impostazione manuale tramite sysctl potrebbe non persistere dopo un riavvio.
#Quale modello per quanta memoria: cosa può contenere un Mac mini
La tabella mette in relazione le dimensioni dei file pubblicati da Ollama con un limite pari a due terzi della RAM (ipotesi prudente). «Sì»: i pesi occupano meno del 70% del limite e resta spazio per la cache KV. «Al limite»: rientrano nel limite, con un contesto breve. «No»: superano il limite. Sono calcoli, non misurazioni.
| Modello | Peso (Ollama) | M4 16 GB | M4 24 GB | M4 32 GB | M4 Pro 48 GB | M4 Pro 64 GB |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | sì | sì | sì | sì | sì |
| Gemma 4 12B | 7,6 GB | Al limite | sì | sì | sì | sì |
| gpt-oss 20B | 14 GB | no | Al limite | sì | sì | sì |
| Mistral Small 24B | 14 GB | no | Al limite | sì | sì | sì |
| Qwen 3.8 27B | 18 GB | no | no | Al limite | sì | sì |
| Qwen3-Coder 30B-A3B | 19 GB | no | no | Al limite | sì | sì |
| Qwen 3.6 35B-A3B (MoE) | 23 GB | no | no | no | Al limite | sì |
| Qwen3-Coder 30B-A3B in Q8_0 | 32 GB | no | no | no | Al limite | Al limite |
#Mac mini M4 16 GB: i modelli da preferire
Con 16 GB, il limite si aggira intorno agli 11 GB. Qwen 3.5 9B (6,6 GB su Ollama) lascia circa 4 GB per la cache KV e i buffer. Gemma 4 12B (7,6 GB) funziona con un contesto breve. Un modello da 14 GB come Mistral Small 24B supera questo limite: Ollama lo distribuisce tra GPU e CPU e la velocità cala. Il comando ollama ps mostra la distribuzione; punta al 100% sulla GPU.
#Velocità di un Mac mini: limite teorico e misure pubblicate
La velocità di generazione è limitata dalla banda passante: token al secondo ≈ banda passante (GB/s) ÷ pesi letti a ogni token (GB). Questo calcolo dà un limite massimo, mai una misura. Per un modello denso da 14 GB, 120 ÷ 14 dà 8,6 token/s al massimo su un M4, e 273 ÷ 14 dà 19,5 su un M4 Pro.
| Modello | Dimensione del modello | M4 (120 GB/s) | M4 Pro (273 GB/s) |
|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | 18 | 41 |
| Gemma 4 12B | 7,6 GB | 16 | 36 |
| Mistral Small 24B | 14 GB | 8,6 | 19,5 |
Le misurazioni pubblicate restano al di sotto di questo limite. Ecco quelle della tabella che la comunità llama.cpp mantiene aggiornata per i chip Apple, con Llama 2 7B. Non sono nostre misurazioni e riguardano un vecchio modello in Q4_0 e Q8_0, ma mostrano il rapporto tra le prestazioni dei chip.
| Chip | Larghezza di banda | Generazione Q4_0 | Generazione Q8_0 | Prompt Q4_0 |
|---|---|---|---|---|
| M4 (GPU a 10 core) | 120 GB/s | 24,1 | 13,5 | 221 |
| M4 Pro (GPU a 16 core) | 273 GB/s | 49,6 | 30,5 | 364 |
| M4 Pro (GPU a 20 core) | 273 GB/s | 50,7 | 30,7 | 440 |
| M5 Pro (GPU a 20 core) | 307 GB/s | 66,3 | 38,9 | 1 621 |
Passare da Q8_0 a Q4_0 accelera la generazione di un fattore 1,8 su M4 e 1,7 su M4 Pro: la dimensione del file conta di più del calcolo. I core GPU incidono soprattutto sulla lettura del prompt (364 contro 440 token/s su M4 Pro). La tabella non contiene nessuna misura M6 alla data di consultazione.
#Mac mini M6 e M5 Pro: cosa cambia nella nuova serie per un LLM
Apple annuncia per il Mac mini M6 una velocità di elaborazione del prompt in LM Studio fino a 4,8 volte quella del M4, e per il M5 Pro fino a 4 volte quella del M4 Pro. Questi miglioramenti riguardano la lettura del prompt, che beneficia degli acceleratori neurali aggiunti in ogni core GPU. La generazione resta determinata dalla banda passante e migliora molto meno: dal 12% (307 contro 273 GB/s) al 42% (170 contro 120 GB/s).
| Chip | Larghezza di banda | Memoria unificata | A riposo / massimo |
|---|---|---|---|
| M4 | 120 GB/s | 16, 24 o 32 GB | 4 W / 65 W |
| M6 | 153 GB/s (16 GB), 170 GB/s (24 GB e oltre) | 16, 24 o 32 GB | 4 W / 70 W |
| M4 Pro | 273 GB/s | 24, 48 o 64 GB | 5 W / 140 W |
| M5 Pro | 307 GB/s | 24, 48 o 64 GB | 6 W / 145 W |
Un M6 di base a 153 GB/s ha solo il 28% di banda passante in più rispetto al M4: il limite teorico di un 9B passa da 18 a circa 23 token/s. La nuova gamma offre vantaggi soprattutto negli usi con contesti lunghi: un RAG che inserisce documenti lunghi, un agente di programmazione che rilegge un repository.
- Acquisto del nuovo, modello da 30 a 35 miliardi
- Un M5 Pro con almeno 48 GB, oppure 64 GB per lavorare comodamente con un MoE da 35 miliardi di parametri: il M6 si ferma a 32 GB.
- M4 ancora in magazzino
- Una scelta sensata per modelli da 7 a 12 miliardi di parametri, se la differenza di prezzo rispetto al M6 è significativa. Le scorte sono limitate.
#Installare un server LLM su un Mac mini con Ollama
Ollama su macOS funziona come un'applicazione, le cui impostazioni si configurano tramite variabili d'ambiente definite con launchctl. Per impostazione predefinita, Ollama ascolta solo su 127.0.0.1, porta 11434: senza modifiche, nessun altro dispositivo può usarlo.
- 01Installare l'applicazione OllamaScarica Ollama da ollama.com e sposta l'applicazione nella cartella Applicazioni. Al primo avvio, l'applicazione propone di creare il collegamento per il comando ollama.
- 02Aprire la porta alla rete localeImposta OLLAMA_HOST con launchctl (comando qui sotto), poi riavvia l'applicazione. L'indirizzo 0.0.0.0 apre l'API a tutta la rete, senza autenticazione: riservalo a una rete fidata.
- 03Impedire la sospensioneIn Impostazioni di Sistema, nella sezione Energia, attiva l'opzione che impedisce la sospensione automatica quando lo schermo è spento: senza questa opzione, il servizio può interrompersi.
- 04Scaricare un modello adattoScegli nella tabella un modello contrassegnato con «sì» per la tua memoria, ad esempio qwen3.5:9b su 16 GB.
- 05Verificare da un altro dispositivoInvia una richiesta all'indirizzo del Mac mini (nome .local o IP), poi avvia ollama ps: la colonna Processor deve mostrare il 100% GPU.
Due impostazioni spesso ricopiate sono inutili qui: la documentazione di Ollama precisa che Flash Attention si attiva automaticamente quando l'hardware lo consente e che OLLAMA_ORIGINS riguarda le estensioni del browser. Invece, quantizzare la cache KV (OLLAMA_KV_CACHE_TYPE=q8_0) ne dimezza all'incirca le dimensioni con una perdita molto ridotta, il che conta con 16 GB quando il contesto si allunga.
#LM Studio : l'alternativa a Ollama
LM Studio richiede un chip Apple Silicon e macOS 14 o successivo; sono consigliati 16 GB di RAM. Carica sia modelli GGUF sia modelli MLX a partire dalla versione 0.3.4. Senza schermo, il demone llmster si avvia con lms daemon up. L'opzione «Serve on Local Network» apre l'API alla rete; l'autenticazione tramite token non è attivata per impostazione predefinita. Il motore MLX di Ollama, presentato in anteprima nel marzo 2026, richiedeva più di 32 GB: un M4 da 16 GB non poteva beneficiarne.
#Ciò che un Mac mini sa offrire: chat, RAG, agenti, cluster
- Server di chat in casa
- Le API di Ollama e LM Studio accettano client che usano il formato OpenAI (Open WebUI, Zed, script). Posizionato vicino al router, il Mac mini serve tutta la casa.
- RAG documentale
- È necessario caricare il modello di generazione e un modello di embedding. nomic-embed-text pesa 274 MB: con 16 GB di memoria, può essere caricato insieme a Qwen 3.5 9B.
- Agente di programmazione
- Un agente invia prompt lunghi a ogni passaggio: la lettura del prompt conta più della generazione, ed è qui che M6 e M5 Pro ottengono i maggiori vantaggi.
#Quanti utenti simultanei?
Per impostazione predefinita, Ollama elabora una richiesta alla volta per modello (OLLAMA_NUM_PARALLEL vale 1). Ogni richiesta parallela aumenta il contesto allocato: secondo la documentazione, 4 richieste con un contesto di 2.000 token allocano 8.000 token. Memoria della cache = cache di una conversazione × richieste parallele. Ogni utente riceve la risposta più lentamente; qui non sono disponibili misurazioni affidabili per un numero preciso di persone.
#Collegare diversi Mac mini in cluster
Solo l'M4 Pro offre Thunderbolt 5 (120 Gb/s); l'M4 si limita a Thunderbolt 4 (40 Gb/s). Il progetto exo supporta RDMA su Thunderbolt 5, che ridurrebbe del 99% la latenza tra le macchine, e dichiara di accelerare i modelli man mano che si aggiungono dispositivi, su macOS 26.2 o successivo. I suoi benchmark riguardano i Mac Studio, non i Mac mini. Un cluster serve innanzitutto a caricare un modello troppo grande per una singola macchina.
- Condividere Ollama sulla rete locale (famiglia, team)
- Sicurezza del server Ollama: autenticazione e reverse proxy
- Exo: trasformare più macchine in un cluster LLM domestico
- Ottimizzare il Mac Apple Silicon: limite GPU, Flash Attention, cache KV
- Scheda hardware: Mac mini M6
- Specifiche hardware: Mac mini M5 Pro
#Mac mini M4 o MacBook Air M4: stesso chip, uso diverso
Il MacBook Air da 13 pollici M4 utilizza lo stesso chip, con la stessa larghezza di banda (120 GB/s) e le stesse opzioni da 16, 24 o 32 GB: la velocità massima è identica. Ciò che cambia è il telaio. La versione precedente di questa guida indicava un rallentamento dell'Air del 20% dopo dieci minuti; nessuna fonte lo conferma e questa indicazione è stata rimossa. Per un servizio sempre attivo, il Mac mini è la scelta naturale; per una postazione portatile (1,24 kg, schermo e batteria inclusi), il MacBook.
- Fonte: Apple, scheda tecnica del Mac mini (2024)
- Fonte: Apple, annuncio dei Mac mini M6 e M5 Pro (agosto 2026)
- Fonte: llama.cpp, prestazioni sui chip Apple della serie M
- Fonte: documentazione Ollama, FAQ (variabili d'ambiente, cache KV)
- Fonte: documentazione LM Studio, modalità server senza interfaccia
#Domande frequenti
Un Mac mini M4 con 16 GB basta per un LLM locale?+
Qual è il miglior LLM per un Mac mini M4 con 16 GB?+
Mac mini M4 o M4 Pro per l'IA locale?+
Il Mac mini M6 è molto più veloce del M4 per un LLM?+
È possibile collegare più Mac mini in cluster per un LLM?+
Quanta energia consuma un Mac mini M4 usato come server LLM 24 ore su 24?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.