Quale LLM su iMac M4 (16 / 24 / 32 GB)? ?
L'iMac M4 gestisce comodamente modelli da 8 a 14 miliardi di parametri in Q4: il suo chip M4 offre 120 GB/s di banda di memoria e una misurazione pubblica indica 24 token al secondo su un 7B in Q4_0 con la GPU a 10 core. La memoria unificata (16, 24 o 32 GB) determina la dimensione massima: 16 GB per un 14B, 24 GB per un 24B lento, 32 GB per un 30B ancora più lento.
Un iMac è innanzitutto uno schermo; per l'IA locale, è soprattutto un chip M4 e una quantità di memoria unificata che non potrai più modificare. Questa guida quantifica quali modelli ogni configurazione permette di eseguire, a quale velocità secondo le misurazioni pubbliche e in quali casi un Mac mini è l'acquisto migliore.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: iMac M4 — 16 GB / 256 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Cosa fa un iMac M4 per l'IA locale
L'iMac M4 esegue bene modelli da 8 a 14 miliardi di parametri e può eseguire modelli più grandi a velocità ridotta. Tre numeri riassumono l'essenziale. Il chip M4 offre 120 GB/s di banda passante della memoria secondo la scheda Apple, pari a un limite teorico di circa 31 token al secondo su un modello 7B in Q4_0. La misurazione pubblica nel repository llama.cpp su un M4 con GPU a 10 core indica 24,11 token al secondo in generazione, pari al 77% di questo limite. Infine, la memoria unificata va da 16 a 32 GB e si sceglie all'acquisto: da essa sola dipendono le dimensioni del modello che si può eseguire. Ciò che manca a questo iMac è la banda passante, non la capacità.
- Chip
- Apple M4; la scheda Apple non offre una variante Pro o Max per l'iMac.
- Larghezza di banda
- 120 GB/s, qualunque sia la configurazione.
- Memoria unificata
- 16 GB di base; 24 GB opzionali su tutte le versioni, 32 GB sul modello a 4 porte.
- Schermo
- 24 pollici 4,5K (4480 × 2520), il che rende poco interessante una GPU più potente: il limite è la memoria.
- Prezzo
- Non indicati qui: Apple li modifica; vedere la pagina hardware del sito.
#Le configurazioni reali: due modelli, non tre
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La pagina di Apple distingue due famiglie. Il modello con 2 porte ha una CPU a 8 core e una GPU a 8 core, con 16 GB di memoria espandibile a 24 GB. Il modello con 4 porte ha una CPU a 10 core e una GPU a 10 core, con 16 GB espandibili a 24 o 32 GB. La banda passante di 120 GB/s è identica. Un errore comune, presente nella vecchia versione di questa pagina, è credere che esista ancora una configurazione da 8 GB: la memoria di base è di 16 GB. Per un LLM, quindi, ciò che conta è puntare al modello con 4 porte se si vogliono 32 GB.
| Versione | GPU | Memoria unificata | Larghezza di banda |
|---|---|---|---|
| 2 porte | 8 core | 16 GB, opzione 24 GB | 120 GB/s |
| 4 porte | 10 core | 16 GB, con opzioni da 24 e 32 GB | 120 GB/s |
Per la generazione di testo, la differenza tra 8 e 10 core GPU è probabilmente piccola: la velocità dipende dalla larghezza di banda, che è identica. Nella tabella di riferimento non sono disponibili misurazioni pubbliche per la variante a 8 core, quindi questa affermazione rimane un'ipotesi. Se hai dubbi, investi nella memoria piuttosto che nei core.
#16, 24 o 32 GB: il budget di memoria
Su un Mac, la memoria è condivisa tra il sistema e la GPU, e macOS ne lascia alla GPU solo una parte. Il parametro iogpu.wired_limit_mb vale 0 per impostazione predefinita, il che significa che il kernel ricava il limite dalla memoria installata. Su un Mac da 32 GB misurato da ModelPiper, Metal metteva a disposizione della GPU 24,96 GiB, pari al 78% della memoria. Comunemente si cita il 75%. Per un iMac, considera quindi circa 11-12 GB per un modello da 16 GB, 17-18 GB per uno da 24 GB e 24-25 GB per uno da 32 GB: sono stime, da verificare sulla tua macchina con il comando sysctl iogpu.wired_limit_mb e lo strumento Metal descritto da ModelPiper.
| Configurazione | Memoria utilizzabile dalla GPU | Il modello più grande ragionevolmente utilizzabile |
|---|---|---|
| 16 GB | ≈ 11–12 GB | Un 14B in Q4 (≈ 9 GB), contesto medio |
| 24 GB | ≈ 17–18 GB | Un 24B in Q4 (≈ 14 GB), contesto breve |
| 32 GB | ≈ 24–25 GB | Un modello da 30B in Q4 (≈ 17–18 GB), contesto medio |
Per superare questi limiti, è possibile aumentare la quota assegnata alla GPU. La guida all'ottimizzazione dei Mac Apple Silicon illustra nel dettaglio questa impostazione e i suoi rischi; non la ripetiamo qui.
- Trarre il massimo da un Mac Apple Silicon: impostazioni macOS
- Calcolatore della memoria per un modello e un contesto dati
#Quali modelli per quale memoria
I pesi in Q4 riportati qui sotto provengono dal catalogo QuelLLM. Si presuppone che il modello rientri nella memoria utilizzabile indicata nella tabella precedente, contesto compreso. La colonna «fluidità» applica a ogni modello il limite massimo di 120 GB/s: si tratta di ordini di grandezza calcolati, non di misurazioni.
| Modello | Dimensione del modello | Configurazione minima | Fluidità attesa su M4 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 16 GB | Fluido (circa 15 token/s) |
| Gemma 4 12B | ≈ 7 GB | 16 GB | Discreta (circa 13 token/s) |
| Phi-4 14B | ≈ 9 GB | 16 GB | Discreta (circa 10 token/s) |
| gpt-oss 20B | ≈ 13 GB | 24 GB | Variabile (MoE: più veloce di un modello denso da 20B) |
| Devstral Small 2 24B | ≈ 14 GB | 24 GB | Lento (circa 6–7 token/s) |
| Gemma 4 31B | ≈ 18 GB | 32 GB | Molto lento (circa 5 token/s) |
La regola è non confondere « entra in memoria » con « è piacevole da usare ». Un modello denso da 24B su un M4 base resta leggibile ma lento, a poche parole al secondo, mentre un modello a esperti (MoE) come gpt-oss 20B o Gemma 4 26B-A4B legge solo pochi miliardi di parametri a ogni token, quindi supera un modello denso di dimensioni comparabili. Per un iMac da 24 o 32 GB, un MoE è spesso la scelta migliore.
Con 24 GB si presenta spesso una scelta: un modello 12B in Q8 (circa 13 GB) o un modello 24B in Q4 (circa 14 GB). I due occupano quasi la stessa memoria, quindi generano a velocità pressoché uguali, intorno a 7 token al secondo in base al limite imposto dalla larghezza di banda. Il secondo offre una maggiore capacità di ragionamento, il primo una fedeltà maggiore al modello originale. A parità di larghezza di banda, è la dimensione del modello in gigabyte a determinare la velocità di generazione, non il numero di parametri.
#Velocità: la larghezza di banda è decisiva
L'unica misura pubblica di riferimento è la tabella del repository llama.cpp dedicata ad Apple Silicon, che testa un LLaMA 7B in Q4_0. Per un M4 con GPU a 10 core e 120 GB/s, riporta 221,29 token al secondo nell'elaborazione del prompt e 24,11 nella generazione. Un M4 Pro con 273 GB/s e GPU a 16 core raggiunge 49,64 nella generazione, cioè poco più del doppio. Questo rapporto è vicino a quello delle larghezze di banda (2,3 volte): è il segno che la generazione dipende dalla memoria, non dal numero di core della GPU.
| Chip | GPU | Larghezza di banda | Generazione tg (t/s) |
|---|---|---|---|
| M4 (iMac 4 porte) | 10 core | 120 GB/s | 24,11 |
| M4 Pro (Mac mini M4 Pro) | 16 core | 273 GB/s | 49,64 |
Queste misurazioni risalgono a una delle prime versioni di llama.cpp; le versioni recenti e MLX possono fare meglio. Considerale un ordine di grandezza. La versione precedente di questa pagina indicava da 28 a 31 token al secondo per un modello 9B in Q5: questo valore supererebbe il limite di 120 GB/s per un modello di queste dimensioni, e lo abbiamo rimosso.
#Tre utilizzi realistici in base alla memoria
Un budget di memoria si comprende meglio se applicato a un caso d'uso. In ogni caso, somma la memoria occupata dal modello, dalla cache del contesto e dagli altri programmi aperti, e confronta il totale con la memoria utilizzabile indicata nella tabella precedente. Il calcolatore del sito fa questa somma per te; tieni a mente solo la logica.
| Uso | Cosa deve essere caricato | Configurazione minima |
|---|---|---|
| Assistente d'ufficio: riassunti, email, traduzione | Un 8B o un 12B in Q4, contesto di qualche migliaio di token | 16 GB |
| Ricerca nei tuoi documenti (RAG) | Un modello di generazione da 12B, un modello di embedding e un reranker caricati insieme | 24 GB per mantenere un margine |
| Assistenza alla programmazione per progetti di medie dimensioni | Un 24B (Devstral Small 2) o un MoE da 20 a 26B, contesto lungo | 24 GB, 32 GB se il contesto aumenta |
Quanto a calore e rumore, non abbiamo trovato alcuna misurazione pubblica di un iMac M4 sottoposto a un carico LLM prolungato, quindi non affermiamo nulla sulla sua ventola. L'unico riferimento affidabile è l'uso: se la generazione dura ore, controlla la frequenza e la temperatura in Monitoraggio Attività e mantieni un contesto ragionevole.
#Avvio
- 01Verificare la memoriaAnnota la quantità di memoria del tuo iMac dal menu Apple, poi da Informazioni su questo Mac. Questa determina l'elenco dei modelli utilizzabili.
- 02Installare Ollama o LM StudioOllama accelera i calcoli sulle GPU Apple tramite l'API Metal. LM Studio offre un'interfaccia grafica ben adatta allo schermo di grandi dimensioni.
- 03Caricare un modello adattoScegli un modello dalla tabella in base alla memoria disponibile, in Q4_K_M, e avvialo con ollama run.
- 04Controllare l'uso della GPUUsa ollama ps per verificare che il modello sia caricato sulla GPU, poi Monitoraggio Attività per monitorare la pressione della memoria.
- 05Limitare il contestoCon 16 GB, mantieni un contesto di qualche migliaio di token per evitare che il sistema ricorra allo swap.
#iMac M4 o Mac mini M4: il vero criterio
Il Mac mini M4 utilizza lo stesso chip e la stessa larghezza di banda; a parità di memoria, quindi, l'iMac non è più lento. Ciò che cambia è lo schermo integrato, non sostituibile, e l'assenza di una variante Pro: l'iMac si ferma a 32 GB e 120 GB/s, mentre il Mac mini M4 Pro raggiunge 273 GB/s secondo la stessa discussione di riferimento. Se il tuo obiettivo è un modello da 24B o più a una velocità adeguata, la larghezza di banda del Mac mini M4 Pro raddoppia il throughput; se invece vuoi un assistente desktop con un modello da 8 a 14B, l'iMac è equivalente.
| Criterio | iMac M4 | Mac mini M4 / M4 Pro |
|---|---|---|
| Larghezza di banda | 120 GB/s | 120 GB/s (M4); 273 GB/s (M4 Pro) |
| Memoria massima | 32 GB | Vedi la pagina del Mac mini |
| Schermo | Integrato 4,5K da 24 pollici | Da scegliere separatamente |
| Velocità misurata 7B Q4_0 | 24,11 t/s | 24,11 t/s (M4) ; 49,64 t/s (M4 Pro) |
| Scalabilità | Nessuna, memoria non sostituibile | Lo stesso per la memoria, schermo sostituibile |
- Mac mini M4 e M4 Pro: quale LLM in base alla memoria
- Scheda hardware del Mac mini M4 Pro
- Specifiche tecniche dell'iMac, Apple
- Performance di llama.cpp su Apple Silicon, repository llama.cpp
- Documentazione Ollama: GPU supportate, tra cui Metal
- ModelPiper: il limite di memoria GPU su Mac
#Domande frequenti
L'iMac M4 è adatto per l'IA locale?+
16, 24 o 32 GB su un iMac M4 per un LLM?+
Qual è la velocità di un LLM su un iMac M4?+
Perché non esiste un iMac M4 Pro?+
Un iMac M4 con GPU a 8 core è sufficiente per un LLM?+
Ollama utilizza la GPU dell'iMac M4?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.