Principiante 11 minMacBook Air

Quale LLM su MacBook Air M4 (16 / 24 / 32 GB) ?

Risposta diretta

Il MacBook Air M4 esegue comodamente modelli da 8 a 12 miliardi di parametri con 16 GB di memoria, un 24B in Q4 con 24 GB e un modello a esperti da 30B con 32 GB. La sua banda di memoria di 120 GB/s limita un 8B in Q4 a circa 24 token al secondo; la memoria, non espandibile, determina la dimensione del modello.

L'Air M4 è il primo Air a partire da 16 GB e ad arrivare a 32 GB. Questa pagina indica quale memoria scegliere, calcola la velocità massima che il chip può raggiungere, propone un confronto con l'Air M5, il MacBook Pro e il Mac mini e segnala i limiti dell'Air.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#MacBook Air M4: 120 GB/s e fino a 32 GB di memoria

Il MacBook Air M4 è il primo Air con 16 GB di memoria unificata nella configurazione di base e la possibilità di arrivare a 32 GB, con una banda passante di 120 GB/s. Per un LLM, questi due valori contano più del numero di core: la memoria determina la dimensione del modello che può essere caricato, la banda passante ne determina la velocità massima. A 120 GB/s, un modello da 8 miliardi di parametri in Q4 non supera in teoria i 24 token al secondo; la velocità reale è inferiore.

Chip
Apple M4: CPU a 10 core (4 ad alte prestazioni, 6 ad alta efficienza), GPU a 8 o 10 core, Neural Engine a 16 core, secondo la scheda tecnica di Apple.
Memoria
16 GB di serie, configurabile a 24 o 32 GB. È saldata: la configurazione si sceglie all'acquisto.
Larghezza di banda
120 GB/s, secondo la scheda Apple, ovvero il 20 % in più rispetto ai 100 GB/s dell'Air M3.
Neural Engine
Apple dichiara fino a 38 000 miliardi di operazioni al secondo per il M4. I motori comunemente utilizzati (Ollama, llama.cpp) vengono eseguiti soprattutto sulla GPU tramite Metal; questa cifra non si traduce quindi in token al secondo.
Raffreddamento
Senza ventola: il calore si disperde attraverso il telaio, il che limita i carichi di lavoro molto prolungati.

Su un Mac non c'è VRAM separata: la GPU utilizza la memoria unificata. Quando si cerca «VRAM del MacBook Air M4», la risposta pratica è la memoria totale meno la parte riservata al sistema, entro il limite che macOS consente alla GPU di utilizzare. Questo limite è regolabile; la guida all'ottimizzazione di macOS del sito spiega come regolarlo e quali rischi comporta.

#16, 24 o 32 GB: scegliere la memoria

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Il modello, il suo contesto e il sistema condividono la memoria. I margini indicati di seguito sono stime prudenti da confrontare con la pressione della memoria in Monitoraggio Attività: circa 11–12 GB per un modello su una macchina da 16 GB, 17–19 GB su 24 GB, 24–26 GB su 32 GB. Le dimensioni dei modelli seguono i valori di riferimento del sito: 8B circa 5 GB, 14B circa 9 GB, 24B circa 14 GB, 32B circa 19–20 GB in Q4.

MacBook Air M4: classe di modello in base alla memoria (Q4_K_M)
MemoriaMargine stimatoClasse di modelli eseguibile senza difficoltàAl limite
16 GB≈ 11–12 GB8-9B con contesto medio, 12B in Q414B in Q4 con contesto breve
24 GB≈ 17–19 GB12-14B agevolmente, 24B in Q4 (≈ 14 GB)27B in Q4 (≈ 16 GB) con contesto ridotto
32 GB≈ 24–26 GB24B in Q5-Q6, 27B in Q4, modelli MoE da 30B32B denso in Q4 (≈ 19-20 GB) con contesto lungo
i
Il livello utile dipende dalla generazione dei modelli
I modelli a esperti (MoE) cambiano il calcolo: un 30B con 3B attivi occupa circa 19 GB in memoria ma rilegge solo una piccola frazione dei pesi a ogni token. Con 32 GB gira molto più velocemente di un modello denso dello stesso peso. Con 16 GB non si carica: la memoria rimane il primo filtro.

La questione è quindi quale dimensione di modello vuoi puntare a usare. Se ti limiti a modelli da 8 a 12 miliardi di parametri, 16 GB bastano. Per modelli da 24B o per un RAG con embedder e reranker in parallelo, 24 GB sono il primo livello che offre un buon margine. Con 32 GB, guadagni soprattutto la possibilità di usare contesti lunghi e modelli MoE da 30B.

#Velocità massima a 120 GB/s

Il principio: ogni token generato richiede la lettura dei pesi attivi. Il limite massimo è la larghezza di banda divisa per la dimensione dei pesi in gigabyte. La tabella applica questa formula al M4 (120 GB/s). Sono limiti massimi calcolati, non misurazioni: la velocità reale dipende dal motore, dalla quantizzazione, dal contesto e dalla temperatura del chip.

Limite teorico di generazione sull'Air M4 (120 GB/s, pesi attivi in Q4): calcolo, non misura
ModelloPesi attiviCalcoloTetto
3B≈ 2 GB120 ÷ 2≈ 60 tok/s
8B≈ 5 GB120 ÷ 5≈ 24 tok/s
9B≈ 6 GB120 ÷ 6≈ 20 tok/s
14B≈ 9 GB120 ÷ 9≈ 13 tok/s
24B≈ 14 GB120 ÷ 14≈ 8–9 tok/s
32B denso≈ 19–20 GB120 ÷ 19,5≈ 6 tok/s

Due conseguenze pratiche. Un 8B in Q4 non supererà circa 24 token al secondo su questo chip: un valore dichiarato di 34 token al secondo per questo modello è impossibile senza un'altra tecnica. E un 24B denso resta intorno a 8 token al secondo nel migliore dei casi, cioè alla velocità di una lettura attenta: una velocità comoda per leggere un testo con calma, lenta per un agente che esegue chiamate in sequenza. Per misurazioni reali, consulta /benchmarks e fonti di terze parti che specificano il chip e la quantizzazione.

#M4 o M5: la generazione successiva cambia la situazione?

Apple propone ora un MacBook Air M5. La scheda annuncia 153 GB/s di banda, contro 120 GB/s per il M4, cioè circa il 28% in più, con le stesse opzioni di 16, 24 o 32 GB di memoria. Per un LLM limitato dalla banda, la differenza teorica di velocità massima è dello stesso ordine: un 8B in Q4 passerebbe da circa 24 a circa 30 token al secondo al massimo.

Air M4 e Air M5: i dati utili per un LLM, secondo Apple
CriterioAir M4Air M5
Larghezza di banda120 GB/s153 GB/s
Memoria16, 24 o 32 GB16, 24 o 32 GB
Limite teorico 8B Q4≈ 24 tok/s≈ 30 tok/s

La memoria, invece, non cambia: un Air M5 16 GB non permette di eseguire più modelli di un Air M4 16 GB. Se trovi un M4 configurato con 24 o 32 GB, è meglio di un M5 16 GB per la dimensione dei modelli; a parità di memoria, l'M5 è più veloce. Confronta i prezzi attuali in negozio: cambiano troppo per essere elencati qui.

#Installare e scegliere il proprio motore

  1. 01
    Installare Ollama
    Scaricalo su ollama.com o con Homebrew. Il tutorial di installazione per macOS spiega l'avvio automatico.
  2. 02
    Avviare un modello in base alla memoria
    9B su 16 GB, 24B in Q4 su 24 GB, un MoE di 30B su 32 GB. Il primo avvio scarica il modello.
  3. 03
    Verificare la GPU
    ollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
  4. 04
    Regolare il contesto
    Con meno di 24 GiB di memoria, Ollama imposta il contesto predefinito a 4.000 token. Aumentalo in base alle reali necessità: anche la cache KV cresce di conseguenza.
Terminale
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

MLX, il framework di Apple, sfrutta la memoria condivisa del Mac senza copiare i dati tra CPU e GPU; LM Studio lo propone sotto forma di modelli MLX. Entrambe le strade funzionano: Ollama per la semplicità e l'API locale, MLX e LM Studio per esplorare i formati Apple. La guida MLX contro llama.cpp confronta i due approcci, senza che sia necessario ripeterne qui le conclusioni.

#Contesto lungo e limite di memoria GPU

Il modello rappresenta solo una parte del consumo di memoria: ogni token di contesto aggiunge una voce alla cache KV e macOS impone un limite alla memoria effettivamente disponibile per la GPU. Ollama utilizza automaticamente la Flash Attention quando il motore e l'hardware lo consentono e permette di quantizzare la cache KV tramite la variabile OLLAMA_KV_CACHE_TYPE (f16 per impostazione predefinita). Con 16 GB, questa impostazione fa spesso la differenza tra un contesto breve e uno di diverse migliaia di token.

Per quanto riguarda MLX, il repository mlx-lm indica che un modello che rientra nella memoria disponibile può spesso essere accelerato aumentando il limite della memoria wired del sistema tramite un'impostazione sysctl. È una modifica del sistema: richiede privilegi di amministratore, non viene necessariamente mantenuta dopo un riavvio e può destabilizzare la macchina se il valore è troppo alto. La guida all'ottimizzazione di macOS descrive in dettaglio la procedura e il valore ragionevole in base alla memoria; non modificare questa impostazione senza aver letto la guida.

Terminale
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

#Air M4, MacBook Pro o Mac mini: quale scegliere per ogni uso

L'Air M4 vince in leggerezza e silenziosità, ma non ha una ventola: un carico prolungato fa diminuire la frequenza del chip. Il MacBook Pro M4 Pro o Max aggiunge ventole, una larghezza di banda da 273 a 546 GB/s e fino a 128 GB di memoria secondo la scheda tecnica Apple; il Mac mini M4 offre un computer fisso con raffreddamento attivo.

Scegliere in base all’uso
Il tuo bisognoMacchina adattaPerché
Chat, riassunti, programmazione leggera, mobilitàAir M4 16 o 24 GBSilenzio, autonomia, modelli da 8 a 14B
Modelli da 24 a 32B, contesto lungoAir M4 32 GB o Mac miniMemoria sufficiente; Mac mini se l'hardware rimane in ufficio
Elaborazioni lunghe, diversi modelliMacBook Pro M4 Pro o Max, Mac miniVentilazione attiva, banda passante superiore
Modelli da 70BMacBook Pro Max o Mac StudioUn modello da 70B pesa circa 40 GB in Q4: fuori portata di un Air

#Limiti da conoscere

Carico prolungato
Senza ventola, una generazione continua per diverse decine di minuti finisce per ridurre la frequenza. In una chat, l'effetto passa inosservato; per l'indicizzazione o le elaborazioni in batch, è meglio una macchina dotata di ventola.
Nessun 70B
Un 70B pesa circa 40 GB in Q4: più dei 32 GB massimi dell'Air.
Il Neural Engine non accelera Ollama
I motori comunemente usati utilizzano la GPU tramite Metal. La NPU entra in gioco solo per alcuni utilizzi con Core ML.
Archiviazione
I modelli occupano diversi gigabyte ciascuno nella cartella dei modelli di Ollama: un SSD da 256 GB si riempie velocemente con diversi modelli da 5 a 15 GB.

#Domande frequenti

FAQ
Il MacBook Air M4 16 GB basta per un LLM locale?+
Sì per modelli da 8 a 12 miliardi di parametri in Q4, che pesano da 5 a 8 GB e lasciano margine al sistema e al contesto. Un modello da 14 miliardi ci sta con un contesto breve. Per un modello da 24B o un RAG pesante, bisogna puntare a 24 o 32 GB, perché la memoria non è espandibile.
Quanti GB di VRAM ha un MacBook Air M4?+
Nessuna VRAM separata: la GPU condivide la memoria unificata con il processore, per un totale di 16, 24 o 32 GB a seconda della configurazione. macOS limita la quota che la GPU può riservare, quindi il modello caricato non può occupare tutta la memoria. La guida all'ottimizzazione di macOS spiega come aumentare questo limite.
Quale velocità ci si può aspettare da un modello 8B su MacBook Air M4?+
Il limite teorico è di 120 GB/s divisi per circa 5 GB, cioè un massimo di 24 token al secondo per un 8B in Q4. La velocità reale è inferiore e dipende dal motore e dal contesto. Una velocità dichiarata nettamente superiore a questo limite deve suscitare diffidenza.
È possibile eseguire un modello da 30 miliardi di parametri su un Air M4?+
Solo sulla versione da 32 GB, e preferibilmente con un modello a esperti con pochi parametri attivi. Un 30B pesa circa 19 GB in Q4: rientra nei 24-26 GB disponibili, ma un 30B denso rimane lento, con un massimo teorico di circa 6 token al secondo. Sulla versione da 16 GB non si carica.
Serve aspettare l'Air M5 per l'IA locale?+
Il M5 offre 153 GB/s contro 120 GB/s, cioè circa il 28% in più di banda passante, ma le stesse opzioni di 16, 24 o 32 GB. Se trovi un M4 con più memoria di un M5 allo stesso budget, scegli la memoria: essa determina la dimensione del modello.
Il MacBook Air M4 si riscalda con un LLM?+
Non ha una ventola, quindi si scalda e riduce la frequenza sotto carico prolungato. Negli scambi brevi, l'effetto è lieve. Per le elaborazioni lunghe, collega il computer alla rete elettrica, sollevalo e scegli un modello più piccolo. Per un carico continuo, preferisci un Mac mini o un MacBook Pro.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.