Principiante 11 miniMac

Quale LLM su iMac M4 (16 / 24 / 32 GB)? ?

Risposta diretta

L'iMac M4 gestisce comodamente modelli da 8 a 14 miliardi di parametri in Q4: il suo chip M4 offre 120 GB/s di banda di memoria e una misurazione pubblica indica 24 token al secondo su un 7B in Q4_0 con la GPU a 10 core. La memoria unificata (16, 24 o 32 GB) determina la dimensione massima: 16 GB per un 14B, 24 GB per un 24B lento, 32 GB per un 30B ancora più lento.

Un iMac è innanzitutto uno schermo; per l'IA locale, è soprattutto un chip M4 e una quantità di memoria unificata che non potrai più modificare. Questa guida quantifica quali modelli ogni configurazione permette di eseguire, a quale velocità secondo le misurazioni pubbliche e in quali casi un Mac mini è l'acquisto migliore.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su macOS 14+
Hardware consigliato

Per questa configurazione: iMac M4 — 16 GB / 256 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#Cosa fa un iMac M4 per l'IA locale

L'iMac M4 esegue bene modelli da 8 a 14 miliardi di parametri e può eseguire modelli più grandi a velocità ridotta. Tre numeri riassumono l'essenziale. Il chip M4 offre 120 GB/s di banda passante della memoria secondo la scheda Apple, pari a un limite teorico di circa 31 token al secondo su un modello 7B in Q4_0. La misurazione pubblica nel repository llama.cpp su un M4 con GPU a 10 core indica 24,11 token al secondo in generazione, pari al 77% di questo limite. Infine, la memoria unificata va da 16 a 32 GB e si sceglie all'acquisto: da essa sola dipendono le dimensioni del modello che si può eseguire. Ciò che manca a questo iMac è la banda passante, non la capacità.

Chip
Apple M4; la scheda Apple non offre una variante Pro o Max per l'iMac.
Larghezza di banda
120 GB/s, qualunque sia la configurazione.
Memoria unificata
16 GB di base; 24 GB opzionali su tutte le versioni, 32 GB sul modello a 4 porte.
Schermo
24 pollici 4,5K (4480 × 2520), il che rende poco interessante una GPU più potente: il limite è la memoria.
Prezzo
Non indicati qui: Apple li modifica; vedere la pagina hardware del sito.

#Le configurazioni reali: due modelli, non tre

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La pagina di Apple distingue due famiglie. Il modello con 2 porte ha una CPU a 8 core e una GPU a 8 core, con 16 GB di memoria espandibile a 24 GB. Il modello con 4 porte ha una CPU a 10 core e una GPU a 10 core, con 16 GB espandibili a 24 o 32 GB. La banda passante di 120 GB/s è identica. Un errore comune, presente nella vecchia versione di questa pagina, è credere che esista ancora una configurazione da 8 GB: la memoria di base è di 16 GB. Per un LLM, quindi, ciò che conta è puntare al modello con 4 porte se si vogliono 32 GB.

Configurazioni dell'iMac M4 utili per un LLM (scheda Apple)
VersioneGPUMemoria unificataLarghezza di banda
2 porte8 core16 GB, opzione 24 GB120 GB/s
4 porte10 core16 GB, con opzioni da 24 e 32 GB120 GB/s

Per la generazione di testo, la differenza tra 8 e 10 core GPU è probabilmente piccola: la velocità dipende dalla larghezza di banda, che è identica. Nella tabella di riferimento non sono disponibili misurazioni pubbliche per la variante a 8 core, quindi questa affermazione rimane un'ipotesi. Se hai dubbi, investi nella memoria piuttosto che nei core.

#16, 24 o 32 GB: il budget di memoria

Su un Mac, la memoria è condivisa tra il sistema e la GPU, e macOS ne lascia alla GPU solo una parte. Il parametro iogpu.wired_limit_mb vale 0 per impostazione predefinita, il che significa che il kernel ricava il limite dalla memoria installata. Su un Mac da 32 GB misurato da ModelPiper, Metal metteva a disposizione della GPU 24,96 GiB, pari al 78% della memoria. Comunemente si cita il 75%. Per un iMac, considera quindi circa 11-12 GB per un modello da 16 GB, 17-18 GB per uno da 24 GB e 24-25 GB per uno da 32 GB: sono stime, da verificare sulla tua macchina con il comando sysctl iogpu.wired_limit_mb e lo strumento Metal descritto da ModelPiper.

Memoria disponibile per il modello (stima al 75 %)
ConfigurazioneMemoria utilizzabile dalla GPUIl modello più grande ragionevolmente utilizzabile
16 GB≈ 11–12 GBUn 14B in Q4 (≈ 9 GB), contesto medio
24 GB≈ 17–18 GBUn 24B in Q4 (≈ 14 GB), contesto breve
32 GB≈ 24–25 GBUn modello da 30B in Q4 (≈ 17–18 GB), contesto medio

Per superare questi limiti, è possibile aumentare la quota assegnata alla GPU. La guida all'ottimizzazione dei Mac Apple Silicon illustra nel dettaglio questa impostazione e i suoi rischi; non la ripetiamo qui.

#Quali modelli per quale memoria

I pesi in Q4 riportati qui sotto provengono dal catalogo QuelLLM. Si presuppone che il modello rientri nella memoria utilizzabile indicata nella tabella precedente, contesto compreso. La colonna «fluidità» applica a ogni modello il limite massimo di 120 GB/s: si tratta di ordini di grandezza calcolati, non di misurazioni.

Modelli per configurazione di memoria (Q4, solo pesi)
ModelloDimensione del modelloConfigurazione minimaFluidità attesa su M4
Llama 3.1 8B≈ 6 GB16 GBFluido (circa 15 token/s)
Gemma 4 12B≈ 7 GB16 GBDiscreta (circa 13 token/s)
Phi-4 14B≈ 9 GB16 GBDiscreta (circa 10 token/s)
gpt-oss 20B≈ 13 GB24 GBVariabile (MoE: più veloce di un modello denso da 20B)
Devstral Small 2 24B≈ 14 GB24 GBLento (circa 6–7 token/s)
Gemma 4 31B≈ 18 GB32 GBMolto lento (circa 5 token/s)

La regola è non confondere « entra in memoria » con « è piacevole da usare ». Un modello denso da 24B su un M4 base resta leggibile ma lento, a poche parole al secondo, mentre un modello a esperti (MoE) come gpt-oss 20B o Gemma 4 26B-A4B legge solo pochi miliardi di parametri a ogni token, quindi supera un modello denso di dimensioni comparabili. Per un iMac da 24 o 32 GB, un MoE è spesso la scelta migliore.

Con 24 GB si presenta spesso una scelta: un modello 12B in Q8 (circa 13 GB) o un modello 24B in Q4 (circa 14 GB). I due occupano quasi la stessa memoria, quindi generano a velocità pressoché uguali, intorno a 7 token al secondo in base al limite imposto dalla larghezza di banda. Il secondo offre una maggiore capacità di ragionamento, il primo una fedeltà maggiore al modello originale. A parità di larghezza di banda, è la dimensione del modello in gigabyte a determinare la velocità di generazione, non il numero di parametri.

#Velocità: la larghezza di banda è decisiva

L'unica misura pubblica di riferimento è la tabella del repository llama.cpp dedicata ad Apple Silicon, che testa un LLaMA 7B in Q4_0. Per un M4 con GPU a 10 core e 120 GB/s, riporta 221,29 token al secondo nell'elaborazione del prompt e 24,11 nella generazione. Un M4 Pro con 273 GB/s e GPU a 16 core raggiunge 49,64 nella generazione, cioè poco più del doppio. Questo rapporto è vicino a quello delle larghezze di banda (2,3 volte): è il segno che la generazione dipende dalla memoria, non dal numero di core della GPU.

Apple Silicon con LLaMA 7B Q4_0 (discussione su llama.cpp)
ChipGPULarghezza di bandaGenerazione tg (t/s)
M4 (iMac 4 porte)10 core120 GB/s24,11
M4 Pro (Mac mini M4 Pro)16 core273 GB/s49,64

Queste misurazioni risalgono a una delle prime versioni di llama.cpp; le versioni recenti e MLX possono fare meglio. Considerale un ordine di grandezza. La versione precedente di questa pagina indicava da 28 a 31 token al secondo per un modello 9B in Q5: questo valore supererebbe il limite di 120 GB/s per un modello di queste dimensioni, e lo abbiamo rimosso.

#Tre utilizzi realistici in base alla memoria

Un budget di memoria si comprende meglio se applicato a un caso d'uso. In ogni caso, somma la memoria occupata dal modello, dalla cache del contesto e dagli altri programmi aperti, e confronta il totale con la memoria utilizzabile indicata nella tabella precedente. Il calcolatore del sito fa questa somma per te; tieni a mente solo la logica.

Usi tipici e configurazione consigliata
UsoCosa deve essere caricatoConfigurazione minima
Assistente d'ufficio: riassunti, email, traduzioneUn 8B o un 12B in Q4, contesto di qualche migliaio di token16 GB
Ricerca nei tuoi documenti (RAG)Un modello di generazione da 12B, un modello di embedding e un reranker caricati insieme24 GB per mantenere un margine
Assistenza alla programmazione per progetti di medie dimensioniUn 24B (Devstral Small 2) o un MoE da 20 a 26B, contesto lungo24 GB, 32 GB se il contesto aumenta

Quanto a calore e rumore, non abbiamo trovato alcuna misurazione pubblica di un iMac M4 sottoposto a un carico LLM prolungato, quindi non affermiamo nulla sulla sua ventola. L'unico riferimento affidabile è l'uso: se la generazione dura ore, controlla la frequenza e la temperatura in Monitoraggio Attività e mantieni un contesto ragionevole.

#Avvio

  1. 01
    Verificare la memoria
    Annota la quantità di memoria del tuo iMac dal menu Apple, poi da Informazioni su questo Mac. Questa determina l'elenco dei modelli utilizzabili.
  2. 02
    Installare Ollama o LM Studio
    Ollama accelera i calcoli sulle GPU Apple tramite l'API Metal. LM Studio offre un'interfaccia grafica ben adatta allo schermo di grandi dimensioni.
  3. 03
    Caricare un modello adatto
    Scegli un modello dalla tabella in base alla memoria disponibile, in Q4_K_M, e avvialo con ollama run.
  4. 04
    Controllare l'uso della GPU
    Usa ollama ps per verificare che il modello sia caricato sulla GPU, poi Monitoraggio Attività per monitorare la pressione della memoria.
  5. 05
    Limitare il contesto
    Con 16 GB, mantieni un contesto di qualche migliaio di token per evitare che il sistema ricorra allo swap.
Terminale
ollama ps
sysctl iogpu.wired_limit_mb
sysctl hw.memsize

#iMac M4 o Mac mini M4: il vero criterio

Il Mac mini M4 utilizza lo stesso chip e la stessa larghezza di banda; a parità di memoria, quindi, l'iMac non è più lento. Ciò che cambia è lo schermo integrato, non sostituibile, e l'assenza di una variante Pro: l'iMac si ferma a 32 GB e 120 GB/s, mentre il Mac mini M4 Pro raggiunge 273 GB/s secondo la stessa discussione di riferimento. Se il tuo obiettivo è un modello da 24B o più a una velocità adeguata, la larghezza di banda del Mac mini M4 Pro raddoppia il throughput; se invece vuoi un assistente desktop con un modello da 8 a 14B, l'iMac è equivalente.

iMac M4 o Mac mini
CriterioiMac M4Mac mini M4 / M4 Pro
Larghezza di banda120 GB/s120 GB/s (M4); 273 GB/s (M4 Pro)
Memoria massima32 GBVedi la pagina del Mac mini
SchermoIntegrato 4,5K da 24 polliciDa scegliere separatamente
Velocità misurata 7B Q4_024,11 t/s24,11 t/s (M4) ; 49,64 t/s (M4 Pro)
ScalabilitàNessuna, memoria non sostituibileLo stesso per la memoria, schermo sostituibile
→
Il criterio decisivo
Scegli l'iMac se vuoi un computer all-in-one e un assistente da 8 a 14B. Scegli un Mac mini M4 Pro se punti a un modello da 24B o più, per il quale la larghezza di banda raddoppia il throughput. I prezzi cambiano: controllali sulle pagine hardware del sito.

#Domande frequenti

FAQ
L'iMac M4 è adatto per l'IA locale?+
Sì per i modelli da 8 a 14 miliardi di parametri: il chip M4 offre 120 GB/s di larghezza di banda e una misurazione pubblica indica 24 token al secondo su un 7B in Q4_0. Rallenta nettamente con i modelli da 24B in su, per insufficiente larghezza di banda, non per mancanza di capacità.
16, 24 o 32 GB su un iMac M4 per un LLM?+
Sedici GB sono sufficienti per un modello da 8B a 14B in Q4, con circa 11-12 GB utilizzabili. Ventiquattro GB consentono di eseguire modelli da 20B a 24B, trentadue GB modelli da 30B in Q4. Poiché la memoria non è sostituibile dopo l'acquisto, punta al modello più grande che pensi di usare, non a quello di oggi.
Qual è la velocità di un LLM su un iMac M4?+
Su un M4 con GPU a 10 core, la tabella di llama.cpp riporta 24,11 token al secondo in generazione con un LLaMA 7B in Q4_0. Il rapporto tra banda passante e peso del modello suggerisce circa 15 token al secondo per un modello recente da 8B in Q4 e da 6 a 7 per un modello denso da 24B: stime da verificare.
Perché non esiste un iMac M4 Pro?+
La pagina di Apple propone solo il chip M4 per l'iMac, nelle versioni con 8 e 10 core GPU. Per una maggiore larghezza di banda, bisogna passare a un Mac mini M4 Pro (273 GB/s), la cui velocità di generazione è più che doppia nella tabella di riferimento.
Un iMac M4 con GPU a 8 core è sufficiente per un LLM?+
Probabilmente sì: con 120 GB/s per tutte le varianti, la generazione dipende poco dal numero di core GPU. Nella tabella di llama.cpp non è disponibile alcuna misurazione per la variante a 8 core, quindi è un'ipotesi. Scegli piuttosto in base alla memoria: 24 GB sono il primo livello davvero utile.
Ollama utilizza la GPU dell'iMac M4?+
Sì: la documentazione di Ollama indica che accelera i calcoli sulle GPU Apple tramite l'API Metal. Verifica con ollama ps che il modello sia caricato sulla GPU e monitora la pressione della memoria in Monitoraggio Attività se ti avvicini al limite della tua configurazione.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.