Quale LLM su MacBook Air M4 (16 / 24 / 32 GB) ?
Il MacBook Air M4 esegue comodamente modelli da 8 a 12 miliardi di parametri con 16 GB di memoria, un 24B in Q4 con 24 GB e un modello a esperti da 30B con 32 GB. La sua banda di memoria di 120 GB/s limita un 8B in Q4 a circa 24 token al secondo; la memoria, non espandibile, determina la dimensione del modello.
L'Air M4 è il primo Air a partire da 16 GB e ad arrivare a 32 GB. Questa pagina indica quale memoria scegliere, calcola la velocità massima che il chip può raggiungere, propone un confronto con l'Air M5, il MacBook Pro e il Mac mini e segnala i limiti dell'Air.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#MacBook Air M4: 120 GB/s e fino a 32 GB di memoria
Il MacBook Air M4 è il primo Air con 16 GB di memoria unificata nella configurazione di base e la possibilità di arrivare a 32 GB, con una banda passante di 120 GB/s. Per un LLM, questi due valori contano più del numero di core: la memoria determina la dimensione del modello che può essere caricato, la banda passante ne determina la velocità massima. A 120 GB/s, un modello da 8 miliardi di parametri in Q4 non supera in teoria i 24 token al secondo; la velocità reale è inferiore.
- Chip
- Apple M4: CPU a 10 core (4 ad alte prestazioni, 6 ad alta efficienza), GPU a 8 o 10 core, Neural Engine a 16 core, secondo la scheda tecnica di Apple.
- Memoria
- 16 GB di serie, configurabile a 24 o 32 GB. È saldata: la configurazione si sceglie all'acquisto.
- Larghezza di banda
- 120 GB/s, secondo la scheda Apple, ovvero il 20 % in più rispetto ai 100 GB/s dell'Air M3.
- Neural Engine
- Apple dichiara fino a 38 000 miliardi di operazioni al secondo per il M4. I motori comunemente utilizzati (Ollama, llama.cpp) vengono eseguiti soprattutto sulla GPU tramite Metal; questa cifra non si traduce quindi in token al secondo.
- Raffreddamento
- Senza ventola: il calore si disperde attraverso il telaio, il che limita i carichi di lavoro molto prolungati.
Su un Mac non c'è VRAM separata: la GPU utilizza la memoria unificata. Quando si cerca «VRAM del MacBook Air M4», la risposta pratica è la memoria totale meno la parte riservata al sistema, entro il limite che macOS consente alla GPU di utilizzare. Questo limite è regolabile; la guida all'ottimizzazione di macOS del sito spiega come regolarlo e quali rischi comporta.
#16, 24 o 32 GB: scegliere la memoria
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Il modello, il suo contesto e il sistema condividono la memoria. I margini indicati di seguito sono stime prudenti da confrontare con la pressione della memoria in Monitoraggio Attività: circa 11–12 GB per un modello su una macchina da 16 GB, 17–19 GB su 24 GB, 24–26 GB su 32 GB. Le dimensioni dei modelli seguono i valori di riferimento del sito: 8B circa 5 GB, 14B circa 9 GB, 24B circa 14 GB, 32B circa 19–20 GB in Q4.
| Memoria | Margine stimato | Classe di modelli eseguibile senza difficoltà | Al limite |
|---|---|---|---|
| 16 GB | ≈ 11–12 GB | 8-9B con contesto medio, 12B in Q4 | 14B in Q4 con contesto breve |
| 24 GB | ≈ 17–19 GB | 12-14B agevolmente, 24B in Q4 (≈ 14 GB) | 27B in Q4 (≈ 16 GB) con contesto ridotto |
| 32 GB | ≈ 24–26 GB | 24B in Q5-Q6, 27B in Q4, modelli MoE da 30B | 32B denso in Q4 (≈ 19-20 GB) con contesto lungo |
La questione è quindi quale dimensione di modello vuoi puntare a usare. Se ti limiti a modelli da 8 a 12 miliardi di parametri, 16 GB bastano. Per modelli da 24B o per un RAG con embedder e reranker in parallelo, 24 GB sono il primo livello che offre un buon margine. Con 32 GB, guadagni soprattutto la possibilità di usare contesti lunghi e modelli MoE da 30B.
#Velocità massima a 120 GB/s
Il principio: ogni token generato richiede la lettura dei pesi attivi. Il limite massimo è la larghezza di banda divisa per la dimensione dei pesi in gigabyte. La tabella applica questa formula al M4 (120 GB/s). Sono limiti massimi calcolati, non misurazioni: la velocità reale dipende dal motore, dalla quantizzazione, dal contesto e dalla temperatura del chip.
| Modello | Pesi attivi | Calcolo | Tetto |
|---|---|---|---|
| 3B | ≈ 2 GB | 120 ÷ 2 | ≈ 60 tok/s |
| 8B | ≈ 5 GB | 120 ÷ 5 | ≈ 24 tok/s |
| 9B | ≈ 6 GB | 120 ÷ 6 | ≈ 20 tok/s |
| 14B | ≈ 9 GB | 120 ÷ 9 | ≈ 13 tok/s |
| 24B | ≈ 14 GB | 120 ÷ 14 | ≈ 8–9 tok/s |
| 32B denso | ≈ 19–20 GB | 120 ÷ 19,5 | ≈ 6 tok/s |
Due conseguenze pratiche. Un 8B in Q4 non supererà circa 24 token al secondo su questo chip: un valore dichiarato di 34 token al secondo per questo modello è impossibile senza un'altra tecnica. E un 24B denso resta intorno a 8 token al secondo nel migliore dei casi, cioè alla velocità di una lettura attenta: una velocità comoda per leggere un testo con calma, lenta per un agente che esegue chiamate in sequenza. Per misurazioni reali, consulta /benchmarks e fonti di terze parti che specificano il chip e la quantizzazione.
#M4 o M5: la generazione successiva cambia la situazione?
Apple propone ora un MacBook Air M5. La scheda annuncia 153 GB/s di banda, contro 120 GB/s per il M4, cioè circa il 28% in più, con le stesse opzioni di 16, 24 o 32 GB di memoria. Per un LLM limitato dalla banda, la differenza teorica di velocità massima è dello stesso ordine: un 8B in Q4 passerebbe da circa 24 a circa 30 token al secondo al massimo.
| Criterio | Air M4 | Air M5 |
|---|---|---|
| Larghezza di banda | 120 GB/s | 153 GB/s |
| Memoria | 16, 24 o 32 GB | 16, 24 o 32 GB |
| Limite teorico 8B Q4 | ≈ 24 tok/s | ≈ 30 tok/s |
La memoria, invece, non cambia: un Air M5 16 GB non permette di eseguire più modelli di un Air M4 16 GB. Se trovi un M4 configurato con 24 o 32 GB, è meglio di un M5 16 GB per la dimensione dei modelli; a parità di memoria, l'M5 è più veloce. Confronta i prezzi attuali in negozio: cambiano troppo per essere elencati qui.
#Installare e scegliere il proprio motore
- 01Installare OllamaScaricalo su ollama.com o con Homebrew. Il tutorial di installazione per macOS spiega l'avvio automatico.
- 02Avviare un modello in base alla memoria9B su 16 GB, 24B in Q4 su 24 GB, un MoE di 30B su 32 GB. Il primo avvio scarica il modello.
- 03Verificare la GPUollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
- 04Regolare il contestoCon meno di 24 GiB di memoria, Ollama imposta il contesto predefinito a 4.000 token. Aumentalo in base alle reali necessità: anche la cache KV cresce di conseguenza.
MLX, il framework di Apple, sfrutta la memoria condivisa del Mac senza copiare i dati tra CPU e GPU; LM Studio lo propone sotto forma di modelli MLX. Entrambe le strade funzionano: Ollama per la semplicità e l'API locale, MLX e LM Studio per esplorare i formati Apple. La guida MLX contro llama.cpp confronta i due approcci, senza che sia necessario ripeterne qui le conclusioni.
#Contesto lungo e limite di memoria GPU
Il modello rappresenta solo una parte del consumo di memoria: ogni token di contesto aggiunge una voce alla cache KV e macOS impone un limite alla memoria effettivamente disponibile per la GPU. Ollama utilizza automaticamente la Flash Attention quando il motore e l'hardware lo consentono e permette di quantizzare la cache KV tramite la variabile OLLAMA_KV_CACHE_TYPE (f16 per impostazione predefinita). Con 16 GB, questa impostazione fa spesso la differenza tra un contesto breve e uno di diverse migliaia di token.
Per quanto riguarda MLX, il repository mlx-lm indica che un modello che rientra nella memoria disponibile può spesso essere accelerato aumentando il limite della memoria wired del sistema tramite un'impostazione sysctl. È una modifica del sistema: richiede privilegi di amministratore, non viene necessariamente mantenuta dopo un riavvio e può destabilizzare la macchina se il valore è troppo alto. La guida all'ottimizzazione di macOS descrive in dettaglio la procedura e il valore ragionevole in base alla memoria; non modificare questa impostazione senza aver letto la guida.
#Air M4, MacBook Pro o Mac mini: quale scegliere per ogni uso
L'Air M4 vince in leggerezza e silenziosità, ma non ha una ventola: un carico prolungato fa diminuire la frequenza del chip. Il MacBook Pro M4 Pro o Max aggiunge ventole, una larghezza di banda da 273 a 546 GB/s e fino a 128 GB di memoria secondo la scheda tecnica Apple; il Mac mini M4 offre un computer fisso con raffreddamento attivo.
| Il tuo bisogno | Macchina adatta | Perché |
|---|---|---|
| Chat, riassunti, programmazione leggera, mobilità | Air M4 16 o 24 GB | Silenzio, autonomia, modelli da 8 a 14B |
| Modelli da 24 a 32B, contesto lungo | Air M4 32 GB o Mac mini | Memoria sufficiente; Mac mini se l'hardware rimane in ufficio |
| Elaborazioni lunghe, diversi modelli | MacBook Pro M4 Pro o Max, Mac mini | Ventilazione attiva, banda passante superiore |
| Modelli da 70B | MacBook Pro Max o Mac Studio | Un modello da 70B pesa circa 40 GB in Q4: fuori portata di un Air |
- MacBook Pro M4 Pro e Max: da 273 a 546 GB/s
- Mac mini M4 e M4 Pro per un LLM
- MacBook Air M2: 100 GB/s, massimo 24 GB
- MLX contro llama.cpp su Mac
- Ottimizzare un Mac Apple Silicon per gli LLM
- Quale LLM per 16 GB di memoria
- Fonte: scheda tecnica Apple del MacBook Air M4
- Fonte: scheda tecnica Apple del MacBook Air attuale
- Fonte: scheda tecnica Apple del MacBook Pro M4 Pro e Max
- Fonte: documentazione Ollama, contesto
#Limiti da conoscere
- Carico prolungato
- Senza ventola, una generazione continua per diverse decine di minuti finisce per ridurre la frequenza. In una chat, l'effetto passa inosservato; per l'indicizzazione o le elaborazioni in batch, è meglio una macchina dotata di ventola.
- Nessun 70B
- Un 70B pesa circa 40 GB in Q4: più dei 32 GB massimi dell'Air.
- Il Neural Engine non accelera Ollama
- I motori comunemente usati utilizzano la GPU tramite Metal. La NPU entra in gioco solo per alcuni utilizzi con Core ML.
- Archiviazione
- I modelli occupano diversi gigabyte ciascuno nella cartella dei modelli di Ollama: un SSD da 256 GB si riempie velocemente con diversi modelli da 5 a 15 GB.
#Domande frequenti
Il MacBook Air M4 16 GB basta per un LLM locale?+
Quanti GB di VRAM ha un MacBook Air M4?+
Quale velocità ci si può aspettare da un modello 8B su MacBook Air M4?+
È possibile eseguire un modello da 30 miliardi di parametri su un Air M4?+
Serve aspettare l'Air M5 per l'IA locale?+
Il MacBook Air M4 si riscalda con un LLM?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.