Principiante 14 minMac mini

Quale LLM su Mac mini M4 / M4 Pro (16–64 GB) ?

Risposta diretta

Un Mac mini M4 fa funzionare correttamente un LLM locale già con 16 GB: modelli da 7 a 12 miliardi di parametri, a circa venti token/s nel migliore dei casi su un 7B in Q4_0, perché la sua banda passante di 120 GB/s limita la velocità. Per puntare a modelli da 14 a 35 miliardi di parametri, serve un M4 Pro (273 GB/s, da 24 a 64 GB). Apple ha sostituito questa gamma nell'agosto 2026 con i Mac mini M6 e M5 Pro.

Questa guida usa i dati di Apple, di llama.cpp e della documentazione di Ollama e LM Studio per aiutarti a decidere: quale chip, quale memoria, quale modello e quale velocità aspettarti. Distingue ciò che Apple annuncia, ciò che la comunità ha misurato e ciò che è soltanto un calcolo, e fa il punto sulla gamma M6 e M5 Pro uscita a settembre 2026.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: Mac mini M5 Pro (24 GB / 512 GB).

Perché questa scelta? La nostra scheda completa su Mac mini M5 Pro (24 GB / 512 GB) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#Mac mini M4 e LLM locale: cosa la macchina sa fare

Un Mac mini è un buon server per LLM locali perché la sua memoria unificata è condivisa tra il processore e la GPU, senza VRAM separata. Due numeri determinano cosa puoi farne. La capacità (da 16 a 64 GB a seconda del chip) determina la dimensione del modello che può essere caricato: da 7 a 12 miliardi di parametri con 16 GB, da 24 a 35 miliardi con 32–48 GB. La banda passante determina la velocità: 120 GB/s per il chip M4, 273 GB/s per l'M4 Pro, secondo Apple. Un LLM rilegge i suoi pesi a ogni token prodotto, quindi la velocità massima è approssimativamente pari alla banda passante divisa per la dimensione dei pesi. Per un modello 7B in Q4_0, la tabella pubblica di llama.cpp riporta 24,1 token/s per un M4 e circa 50 per un M4 Pro. Apple ha presentato nell'agosto 2026 i Mac mini M6 e M5 Pro che sostituiscono questa gamma; l'M4 era ancora disponibile presso alcuni rivenditori a fine agosto.

Mac mini M4
CPU a 10 core, GPU a 10 core, 120 GB/s, 16 GB di memoria unificata (24 o 32 GB opzionali), Thunderbolt 4.
Mac mini M4 Pro
CPU a 12 core, GPU a 16 core (14 e 20 come opzioni), 273 GB/s, 24 GB di memoria (48 o 64 GB come opzioni), Thunderbolt 5.
Dimensioni e rumorosità
12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) o 0,73 kg (M4 Pro); 5 dBA a riposo, secondo Apple.
Consumo annunciato
M4: 4 W a riposo, 65 W al massimo. M4 Pro: 5 W e 140 W. Apple non pubblica valori durante l'inferenza.
!
La gamma M4 è stata sostituita nell'agosto 2026
Apple ha presentato i Mac mini M6 e M5 Pro ad agosto 2026, disponibili a partire dal 22 settembre. Le tabelle qui sotto valgono per un M4 già acquistato, disponibile in stock o usato.

#Mac mini M4 o M4 Pro: la banda passante è decisiva

Il kit Mac

Sai quale modello rientra nella memoria del tuo Mac mini M4. Il kit Mac ti insegna a sfruttarlo al massimo: aumentare il limite di memoria della GPU (cap. 2), scegliere tra MLX e GGUF (cap. 3) e trasformare il tuo Mac mini in un server IA per tutta la casa (cap. 12).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Tra i due chip, la vera differenza non è la memoria massima (32 GB contro 64 GB), ma la larghezza di banda, moltiplicata per 2,3 (273 ÷ 120). Nella tabella di llama.cpp, il rapporto misurato è di 2,1 nella generazione (50,7 ÷ 24,1 in Q4_0) e di 2,0 nella lettura del prompt (440 ÷ 221).

Mac mini M4 e M4 Pro per un LLM (fonti: Apple, llama.cpp)
CriterioMac mini M4Mac mini M4 Pro
Banda passante della memoria (Apple)120 GB/s273 GB/s
Memoria unificata (Apple)16 GB, opzione 24 o 32 GB24 GB, opzione 48 o 64 GB
Generazione, Llama 2 7B in Q4_0 (llama.cpp)24,1 token/s50,7 token/s (GPU a 20 core)
Generazione, stesso modello in Q8_013,5 token/s30,7 token/s
Lettura del prompt, Q4_0221 token/s440 token/s
Porte Thunderbolt (Apple)Thunderbolt 4, 40 Gb/sThunderbolt 5, 120 Gb/s
Il M4 basta se
sei solo, punti a modelli fino a 12 miliardi di parametri (Qwen 3.5 9B, Gemma 4 12B) e accetti una ventina di token/s nel migliore dei casi. Scegli 24 GB per tenere caricato anche un modello di embedding.
L'M4 Pro è la scelta obbligata se
punti a modelli da 14 a 27 miliardi di parametri, a un MoE da 30 a 35 miliardi (almeno 48 GB), a un agente di programmazione o all'uso da parte di più utenti. Oltre 64 GB, serve un Mac Studio.

#VRAM su Mac mini: la memoria unificata e il limite utilizzabile dalla GPU

Un Mac mini non ha VRAM separata, ma la GPU non può utilizzare tutta la memoria. Secondo gli utenti di llama.cpp, il limite predefinito va da due terzi a tre quarti della RAM; all'avvio, llama.cpp mostra la riga recommendedMaxWorkingSetSize, che indica il valore effettivo. Il parametro iogpu.wired_limit_mb vale 0 per default, il che significa «politica predefinita del sistema» e non «illimitato».

Limite predefinito di memoria per la GPU, stimato ai due terzi e ai tre quarti della RAM
Memoria del Mac miniLimite GPU stimatoMemoria rimanente per macOS
16 GBDa 10,7 a 12 GBDa 4 a 5 GB
24 GBDa 16 a 18 GBDa 6 a 8 GB
32 GBDa 21 a 24 GBDa 8 a 11 GB
48 GBDa 32 a 36 GBDa 12 a 16 GB
64 GBDa 43 a 48 GB16–21 GB

Il limite di memoria deve essere sufficiente per i pesi, la cache KV (la memoria del contesto, che cresce con la conversazione) e i buffer di calcolo. Per caricare un modello che sfiora il limite, si aumenta questa soglia: MLX consiglia un valore superiore alla dimensione del modello in megabyte, ma inferiore alla memoria della macchina. Lascia diversi gigabyte a macOS, altrimenti la velocità crolla. Un'impostazione manuale tramite sysctl potrebbe non persistere dopo un riavvio.

Leggere e poi aumentare il limite (esempio: M4 Pro 48 GB)
# Valeur actuelle : 0 = plafond par défaut du système
sysctl iogpu.wired_limit_mb

# 40 Go pour le GPU sur 48 Go de RAM (40 x 1024 = 40960 Mo)
sudo sysctl iogpu.wired_limit_mb=40960

#Quale modello per quanta memoria: cosa può contenere un Mac mini

La tabella mette in relazione le dimensioni dei file pubblicati da Ollama con un limite pari a due terzi della RAM (ipotesi prudente). «Sì»: i pesi occupano meno del 70% del limite e resta spazio per la cache KV. «Al limite»: rientrano nel limite, con un contesto breve. «No»: superano il limite. Sono calcoli, non misurazioni.

Quantizzazione predefinita di Ollama salvo diversa indicazione: il modello rientra nel limite di memoria predefinito per la GPU?
ModelloPeso (Ollama)M4 16 GBM4 24 GBM4 32 GBM4 Pro 48 GBM4 Pro 64 GB
Qwen 3.5 9B6,6 GBsìsìsìsìsì
Gemma 4 12B7,6 GBAl limitesìsìsìsì
gpt-oss 20B14 GBnoAl limitesìsìsì
Mistral Small 24B14 GBnoAl limitesìsìsì
Qwen 3.8 27B18 GBnonoAl limitesìsì
Qwen3-Coder 30B-A3B19 GBnonoAl limitesìsì
Qwen 3.6 35B-A3B (MoE)23 GBnononoAl limitesì
Qwen3-Coder 30B-A3B in Q8_032 GBnononoAl limiteAl limite

#Mac mini M4 16 GB: i modelli da preferire

Con 16 GB, il limite si aggira intorno agli 11 GB. Qwen 3.5 9B (6,6 GB su Ollama) lascia circa 4 GB per la cache KV e i buffer. Gemma 4 12B (7,6 GB) funziona con un contesto breve. Un modello da 14 GB come Mistral Small 24B supera questo limite: Ollama lo distribuisce tra GPU e CPU e la velocità cala. Il comando ollama ps mostra la distribuzione; punta al 100% sulla GPU.

→
Un MoE riduce il tempo per token, non la memoria
Qwen3-Coder 30B-A3B ha complessivamente 30,5 miliardi di parametri, ma 3,3 miliardi attivi per token: legge pochi pesi ed è veloce, ma l'intero file (19 GB) rimane in memoria. Non entra quindi nella memoria di un Mac mini da 16 GB, nonostante i suoi 3 miliardi di parametri attivi.

#Velocità di un Mac mini: limite teorico e misure pubblicate

La velocità di generazione è limitata dalla banda passante: token al secondo ≈ banda passante (GB/s) ÷ pesi letti a ogni token (GB). Questo calcolo dà un limite massimo, mai una misura. Per un modello denso da 14 GB, 120 ÷ 14 dà 8,6 token/s al massimo su un M4, e 273 ÷ 14 dà 19,5 su un M4 Pro.

Limite teorico in token/s (banda passante ÷ peso Ollama, modelli densi)
ModelloDimensione del modelloM4 (120 GB/s)M4 Pro (273 GB/s)
Qwen 3.5 9B6,6 GB1841
Gemma 4 12B7,6 GB1636
Mistral Small 24B14 GB8,619,5

Le misurazioni pubblicate restano al di sotto di questo limite. Ecco quelle della tabella che la comunità llama.cpp mantiene aggiornata per i chip Apple, con Llama 2 7B. Non sono nostre misurazioni e riguardano un vecchio modello in Q4_0 e Q8_0, ma mostrano il rapporto tra le prestazioni dei chip.

llama.cpp, Llama 2 7B: tokens/s (discussione GitHub 4167, commit 8e672ef)
ChipLarghezza di bandaGenerazione Q4_0Generazione Q8_0Prompt Q4_0
M4 (GPU a 10 core)120 GB/s24,113,5221
M4 Pro (GPU a 16 core)273 GB/s49,630,5364
M4 Pro (GPU a 20 core)273 GB/s50,730,7440
M5 Pro (GPU a 20 core)307 GB/s66,338,91 621

Passare da Q8_0 a Q4_0 accelera la generazione di un fattore 1,8 su M4 e 1,7 su M4 Pro: la dimensione del file conta di più del calcolo. I core GPU incidono soprattutto sulla lettura del prompt (364 contro 440 token/s su M4 Pro). La tabella non contiene nessuna misura M6 alla data di consultazione.

i
Un modello di ragionamento risponde lentamente
Un modello che riflette produce spesso 2.000 token prima di rispondere. A 8 token/s (un modello denso 14B su M4), ci vogliono 250 secondi, più di 4 minuti. A 19 token/s su M4 Pro, circa 105 secondi. Questo calcolo influisce sulla scelta tra M4 e M4 Pro.

#Mac mini M6 e M5 Pro: cosa cambia nella nuova serie per un LLM

Apple annuncia per il Mac mini M6 una velocità di elaborazione del prompt in LM Studio fino a 4,8 volte quella del M4, e per il M5 Pro fino a 4 volte quella del M4 Pro. Questi miglioramenti riguardano la lettura del prompt, che beneficia degli acceleratori neurali aggiunti in ogni core GPU. La generazione resta determinata dalla banda passante e migliora molto meno: dal 12% (307 contro 273 GB/s) al 42% (170 contro 120 GB/s).

I quattro chip (fonte: Apple)
ChipLarghezza di bandaMemoria unificataA riposo / massimo
M4120 GB/s16, 24 o 32 GB4 W / 65 W
M6153 GB/s (16 GB), 170 GB/s (24 GB e oltre)16, 24 o 32 GB4 W / 70 W
M4 Pro273 GB/s24, 48 o 64 GB5 W / 140 W
M5 Pro307 GB/s24, 48 o 64 GB6 W / 145 W

Un M6 di base a 153 GB/s ha solo il 28% di banda passante in più rispetto al M4: il limite teorico di un 9B passa da 18 a circa 23 token/s. La nuova gamma offre vantaggi soprattutto negli usi con contesti lunghi: un RAG che inserisce documenti lunghi, un agente di programmazione che rilegge un repository.

Acquisto del nuovo, modello da 30 a 35 miliardi
Un M5 Pro con almeno 48 GB, oppure 64 GB per lavorare comodamente con un MoE da 35 miliardi di parametri: il M6 si ferma a 32 GB.
M4 ancora in magazzino
Una scelta sensata per modelli da 7 a 12 miliardi di parametri, se la differenza di prezzo rispetto al M6 è significativa. Le scorte sono limitate.

#Installare un server LLM su un Mac mini con Ollama

Ollama su macOS funziona come un'applicazione, le cui impostazioni si configurano tramite variabili d'ambiente definite con launchctl. Per impostazione predefinita, Ollama ascolta solo su 127.0.0.1, porta 11434: senza modifiche, nessun altro dispositivo può usarlo.

  1. 01
    Installare l'applicazione Ollama
    Scarica Ollama da ollama.com e sposta l'applicazione nella cartella Applicazioni. Al primo avvio, l'applicazione propone di creare il collegamento per il comando ollama.
  2. 02
    Aprire la porta alla rete locale
    Imposta OLLAMA_HOST con launchctl (comando qui sotto), poi riavvia l'applicazione. L'indirizzo 0.0.0.0 apre l'API a tutta la rete, senza autenticazione: riservalo a una rete fidata.
  3. 03
    Impedire la sospensione
    In Impostazioni di Sistema, nella sezione Energia, attiva l'opzione che impedisce la sospensione automatica quando lo schermo è spento: senza questa opzione, il servizio può interrompersi.
  4. 04
    Scaricare un modello adatto
    Scegli nella tabella un modello contrassegnato con «sì» per la tua memoria, ad esempio qwen3.5:9b su 16 GB.
  5. 05
    Verificare da un altro dispositivo
    Invia una richiesta all'indirizzo del Mac mini (nome .local o IP), poi avvia ollama ps: la colonna Processor deve mostrare il 100% GPU.
Server Ollama sul Mac mini
# Écoute sur tout le réseau local, puis relancer l'application Ollama
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Modèle pour 16 Go de mémoire
ollama pull qwen3.5:9b

# Test depuis un autre appareil (remplacez l'adresse)
curl http://mac-mini.local:11434/api/chat -d '{"model": "qwen3.5:9b", "messages": [{"role": "user", "content": "Bonjour"}], "stream": false}'

Due impostazioni spesso ricopiate sono inutili qui: la documentazione di Ollama precisa che Flash Attention si attiva automaticamente quando l'hardware lo consente e che OLLAMA_ORIGINS riguarda le estensioni del browser. Invece, quantizzare la cache KV (OLLAMA_KV_CACHE_TYPE=q8_0) ne dimezza all'incirca le dimensioni con una perdita molto ridotta, il che conta con 16 GB quando il contesto si allunga.

#LM Studio : l'alternativa a Ollama

LM Studio richiede un chip Apple Silicon e macOS 14 o successivo; sono consigliati 16 GB di RAM. Carica sia modelli GGUF sia modelli MLX a partire dalla versione 0.3.4. Senza schermo, il demone llmster si avvia con lms daemon up. L'opzione «Serve on Local Network» apre l'API alla rete; l'autenticazione tramite token non è attivata per impostazione predefinita. Il motore MLX di Ollama, presentato in anteprima nel marzo 2026, richiedeva più di 32 GB: un M4 da 16 GB non poteva beneficiarne.

#Ciò che un Mac mini sa offrire: chat, RAG, agenti, cluster

Server di chat in casa
Le API di Ollama e LM Studio accettano client che usano il formato OpenAI (Open WebUI, Zed, script). Posizionato vicino al router, il Mac mini serve tutta la casa.
RAG documentale
È necessario caricare il modello di generazione e un modello di embedding. nomic-embed-text pesa 274 MB: con 16 GB di memoria, può essere caricato insieme a Qwen 3.5 9B.
Agente di programmazione
Un agente invia prompt lunghi a ogni passaggio: la lettura del prompt conta più della generazione, ed è qui che M6 e M5 Pro ottengono i maggiori vantaggi.

#Quanti utenti simultanei?

Per impostazione predefinita, Ollama elabora una richiesta alla volta per modello (OLLAMA_NUM_PARALLEL vale 1). Ogni richiesta parallela aumenta il contesto allocato: secondo la documentazione, 4 richieste con un contesto di 2.000 token allocano 8.000 token. Memoria della cache = cache di una conversazione × richieste parallele. Ogni utente riceve la risposta più lentamente; qui non sono disponibili misurazioni affidabili per un numero preciso di persone.

#Collegare diversi Mac mini in cluster

Solo l'M4 Pro offre Thunderbolt 5 (120 Gb/s); l'M4 si limita a Thunderbolt 4 (40 Gb/s). Il progetto exo supporta RDMA su Thunderbolt 5, che ridurrebbe del 99% la latenza tra le macchine, e dichiara di accelerare i modelli man mano che si aggiungono dispositivi, su macOS 26.2 o successivo. I suoi benchmark riguardano i Mac Studio, non i Mac mini. Un cluster serve innanzitutto a caricare un modello troppo grande per una singola macchina.

#Mac mini M4 o MacBook Air M4: stesso chip, uso diverso

Il MacBook Air da 13 pollici M4 utilizza lo stesso chip, con la stessa larghezza di banda (120 GB/s) e le stesse opzioni da 16, 24 o 32 GB: la velocità massima è identica. Ciò che cambia è il telaio. La versione precedente di questa guida indicava un rallentamento dell'Air del 20% dopo dieci minuti; nessuna fonte lo conferma e questa indicazione è stata rimossa. Per un servizio sempre attivo, il Mac mini è la scelta naturale; per una postazione portatile (1,24 kg, schermo e batteria inclusi), il MacBook.

#Domande frequenti

Un Mac mini M4 con 16 GB basta per un LLM locale?+
Sì, per modelli da 7 a 12 miliardi di parametri. Qwen 3.5 9B (6,6 GB) rientra nel limite di memoria GPU di circa 11 GB con un contesto ragionevole. Aspettati, nel migliore dei casi, una ventina di token/s: il M4 arriva al massimo a 120 GB/s. Oltre i 12 miliardi di parametri, scegli 24 GB o un M4 Pro.
Qual è il miglior LLM per un Mac mini M4 con 16 GB?+
Qwen 3.5 9B è la scelta più affidabile: con i suoi 6,6 GB su Ollama, lascia spazio alla cache KV. Gemma 4 12B (7,6 GB) ci sta con un contesto breve. Evita i modelli da 14 GB in su: vengono eseguiti in parte sulla CPU e rallentano.
Mac mini M4 o M4 Pro per l'IA locale?+
Il M4 Pro, se punti a modelli con più di 12 miliardi di parametri: i suoi 273 GB/s contro 120 GB/s raddoppiano approssimativamente la velocità di generazione, e le configurazioni da 48 e 64 GB consentono di eseguire i MoE da 30 a 35 miliardi. Per un modello 9B usato da una sola persona, il M4 basta.
Il Mac mini M6 è molto più veloce del M4 per un LLM?+
Per la lettura del prompt, sì: Apple annuncia una velocità fino a 4,8 volte superiore in LM Studio. Per la generazione, no: la banda passante passa da 120 a 153 GB/s sul M6 di base, cioè circa il 28% in più. Le risposte brevi cambiano poco, i contesti lunghi molto.
È possibile collegare più Mac mini in cluster per un LLM?+
Sì, con uno strumento come exo, soprattutto per caricare un modello troppo grande per una singola macchina. Il M4 Pro offre Thunderbolt 5 (120 Gb/s), il M4 solo Thunderbolt 4 (40 Gb/s). I miglioramenti pubblicati da exo riguardano Mac Studio: verificali sulla tua configurazione.
Quanta energia consuma un Mac mini M4 usato come server LLM 24 ore su 24?+
Apple dichiara 4 W a riposo e un massimo di 65 W per il M4 (5 W e 140 W per il M4 Pro). Restando sempre a riposo, 4 W × 8.760 h danno circa 35 kWh all'anno; moltiplica per la tua tariffa al kWh. Durante l'inferenza, Apple non pubblica alcun dato: una presa con wattmetro fornisce il valore reale.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.