Principiante 11 minMacBook Air

Quale LLM su MacBook Air M3 (8 / 16 / 24 GB) ?

Risposta diretta

IA locale su MacBook Air M3: con 16 GB di memoria unificata, un modello da 8 a 9 miliardi di parametri in Q4 va benissimo; con 8 GB, rimani a 3-4B; con 24 GB, un modello da 24B si carica ma la banda passante di 100 GB/s lo rende lento. L'M3 non è più veloce dell'M2 per generare testo: i dati pubblicati danno velocità quasi identiche. Non confonderlo con Apple Intelligence, che è un servizio diverso.

Il MacBook Air M3 è il portatile Apple più diffuso per provare l'IA locale. È silenzioso, senza ventola, e gestisce senza problemi modelli da 8 a 9 miliardi di parametri. Ecco cosa permette ogni configurazione di memoria, cosa dicono le misure pubblicate sulla velocità, cosa non è cambiato dal M2 e quali impostazioni contano davvero.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#MacBook Air M3 nel 2026: la scheda tecnica utile ai LLM

Secondo la scheda tecnica di Apple, il chip M3 del MacBook Air combina una CPU a 8 core (4 ad alte prestazioni e 4 ad alta efficienza), una GPU a 8 o 10 core, un Neural Engine a 16 core e una larghezza di banda della memoria di 100 GB/s. La memoria unificata è saldata: Apple elenca due configurazioni di base, da 8 GB o 16 GB, entrambe espandibili a 24 GB al momento dell'acquisto. Il modello è disponibile nelle versioni da 13 e 15 pollici con lo stesso chip.

Larghezza di banda
100 GB/s, uguale a quella del M2. È proprio questa, più del numero di core GPU, a limitare la velocità di generazione.
Raffreddamento
Senza ventola. Il chip può dissipare il calore solo attraverso lo chassis: durante una generazione lunga, finisce per ridurre la propria frequenza.
Neural Engine
16 core, ma gli strumenti più comuni per l'IA locale (Ollama, llama.cpp, LM Studio) sfruttano la GPU tramite Metal, non il Neural Engine.
Novità del M3
Il Dynamic Caching, che alloca in tempo reale la memoria locale della GPU. Non disponiamo di misure del suo effetto sui LLM e non facciamo promesse al riguardo.
i
Cosa non ha cambiato il M3
L'M3 mantiene i 100 GB/s dell'M2. La tabella dei risultati di llama.cpp lo conferma: un Llama 7B in Q4_0 genera 21,34 token al secondo sull'M3 contro 21,91 sull'M2 (Q8_0: 12,27 contro 12,21). Passare da un Air M2 a un Air M3 non accelera quindi la generazione del testo. La banda passante cambia solo con l'M4, a 120 GB/s.

#IA locale o Apple Intelligence: due cose diverse

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Molte ricerche sul MacBook Air M3 riguardano l'«IA» in senso ampio. Apple Intelligence è la suite di funzioni integrata in macOS (riassunti, scrittura, Siri); secondo Apple, funziona sui Mac dotati di un chip M1 o più recente, quindi sul MacBook Air M3. Non ti permette di scegliere il modello, né di esporre un'API, né di lavorare sui tuoi documenti con un modello aperto.

L'IA locale, di cui si parla in questa guida, consiste nello scaricare un modello aperto (Qwen, Gemma, Granite, Mistral) ed eseguirlo con Ollama, LM Studio o MLX. Decidi tu il modello, la dimensione del contesto e ciò che rimane sulla macchina. Entrambi possono coesistere; la memoria, però, è condivisa e un modello da 9 miliardi di parametri, una volta caricato, riduce quella disponibile per macOS e le applicazioni.

#Quanta memoria: 8, 16 o 24 GB

La memoria è il primo criterio, perché un modello che supera la capacità disponibile non rallenta: diventa inutilizzabile. Su Apple Silicon, la GPU non può utilizzare tutta la memoria unificata; secondo le discussioni nel repository llama.cpp, Metal ne assegna per impostazione predefinita tra i due terzi e i tre quarti. Su una macchina da 16 GB, considera circa 10–12 GB per il modello e il suo contesto.

Cosa permette ogni configurazione (peso in Q4 del catalogo QuelLLM)
MemoriaUtilizzabile per il modello (stima)Modelli che rientrano comodamente in memoriaCiò che entra a malapena in memoria
8 GBDa 5 a 6 GBQwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB)Granite 4.2 8B (4,6 GB), contesto breve
16 GBDa 10 a 12 GBQwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB)Modelli di 14 GB e oltre: no
24 GBDa 16 a 18 GBQwen 3.5 9B in Q8, Gemma 4 12B, modelli da 14 a 16 GBMistral Small 3.2 24B (14 GB) o Qwen 3.5 27B (16 GB): si caricano, ma sono lenti

La colonna «utilizzabile» è una stima basata sulla regola che va dai due terzi ai tre quarti, non un valore fornito da Apple. La versione da 8 GB si giustifica solo se sai che continuerai a usare modelli piccoli; poiché non è possibile aggiungere memoria in seguito, la versione da 16 GB è la scelta ragionevole per l'IA locale. Per verificare che un modello e il suo contesto rientrino nella memoria disponibile, il calcolatore di memoria del sito fornisce il totale.

#Quale modello scegliere e quale velocità aspettarsi

La velocità di generazione è limitata dalla banda passante divisa per la dimensione dei pesi letti a ogni token. Con 100 GB/s, un modello da 4,6 GB ha un limite di circa 21 token al secondo, uno da 6 GB di circa 16, uno da 14 GB di circa 7. Nelle misurazioni pubblicate per un Llama 7B, l'M3 raggiunge 21,34 token al secondo in Q4_0, cioè circa l'80% del limite massimo. Si tratta di limiti teorici, non di garanzie.

Limite massimo teorico con una banda passante di 100 GB/s in funzione della dimensione dei pesi
Modello (Q4)Dimensione del modelloLimite (100 ÷ peso)Da ricordare
Qwen 3.5 4B2,3 GBcirca 43 t/sMolto fluido, risposte brevi e rapide
Granite 4.2 8B4,6 GBcirca 21 t/sBuon compromesso per la chat e la sintesi
Qwen 3.5 9B6 GBcirca 16 t/sLa scelta di 16 GB per la qualità
Gemma 4 12B7 GBcirca 14 t/sFunziona discretamente con 16 GB e un contesto moderato
Mistral Small 3.2 24B14 GBcirca 7 t/sLeggibile, ma non più un uso interattivo
Qwen 3.5 27B16 GBcirca 6 t/sDa riservare alle attività lunghe su macchine da 24 GB

Se il risultato è troppo lento, non serve intervenire su un'impostazione, ma sulla dimensione del modello: passare da 9B a 4B raddoppia all'incirca il throughput. Per il codice, un modello specializzato da 7 a 9B è più utile di un 24B troppo lento per essere usato in tempo reale. La tabella delle velocità del sito (/benchmarks) raccoglie le misurazioni pubblicate per ciascun hardware.

#Senza ventola: il calore limita le generazioni lunghe

Il MacBook Air non ha una ventola. Per una domanda breve, non lo noterai. Per un riassunto di diverse decine di pagine o una generazione di diversi minuti, il chip si scalda e finisce per ridurre la propria frequenza, e quindi la velocità di elaborazione. Il fenomeno dipende dalla stanza, dal carico e dall'ambiente; non abbiamo misurazioni da citare, ed è meglio verificarlo sul tuo computer con una generazione lunga.

Posizionare la macchina su un supporto ventilato
Un supporto in alluminio o una superficie dura aiuta il telaio a disperdere il calore; un divano o un letto lo impedisce.
Pianificare pause
Per i compiti lunghi, suddividi il lavoro in lotti anziché eseguire un'unica generazione di diversi minuti.
Ridurre le dimensioni del modello
Un modello 4B o 8B si riscalda nettamente meno di un modello che saturi continuamente la banda passante.
Collegare all’alimentazione di rete
Quando il computer è alimentato a batteria, macOS può limitare le prestazioni per risparmiare energia.

#Installare Ollama e avviare un primo modello

Ollama richiede macOS Sonoma (14) o successivo. La soluzione più semplice è scaricare l'applicazione dal sito ufficiale; la guida all'installazione descrive in dettaglio l'alternativa con Homebrew. Una volta avviata, l'applicazione è in ascolto sulla porta 11434 della macchina e i modelli si scaricano con un solo comando.

  1. 01
    Installare Ollama
    Scarica l'applicazione o segui la guida di installazione su macOS, poi avviala per la prima volta.
  2. 02
    Scegliere un modello in base alla memoria
    8 GB: un modello da 3 a 4 miliardi di parametri. 16 GB: un 8B (5,2 GB nella libreria Ollama). 24 GB: un 14B (9,3 GB) o più.
  3. 03
    Avviare la generazione
    Esegui ollama run seguito dal nome del modello: il download avviene alla prima esecuzione.
  4. 04
    Verificare la memoria durante l'uso
    Apri Monitoraggio Attività, scheda Memoria: la pressione deve rimanere verde. Se diventa gialla o rossa, il modello è troppo grande o il contesto troppo lungo.
Primo modello su 16 GB
ollama run qwen3:8b

La libreria Ollama indica 5,2 GB per qwen3:8b e 9,3 GB per qwen3:14b. Il secondo è adatto a un MacBook Air con 24 GB, ma non a uno con 16 GB, dove lascia troppo poco margine. Se vuoi provare MLX anziché Ollama, la guida dedicata spiega la differenza e i limiti di ciascuno strumento.

#Due impostazioni di Ollama importanti con 16 GB

Il primo è la dimensione del contesto. La FAQ ufficiale di Ollama indica una finestra predefinita di 4.096 token, modificabile; ampliarla consuma memoria per la cache. Per documenti lunghi, aumentala progressivamente invece di impostare un valore massimo. Il secondo è la quantizzazione della cache KV: secondo la stessa FAQ, Ollama accetta la variabile OLLAMA_KV_CACHE_TYPE con il valore q8_0, che utilizza circa la metà della memoria del formato f16 predefinito, a condizione che Flash Attention sia attivata.

Ridurre la cache di contesto a metà
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

Su Mac, la FAQ specifica che, quando Ollama viene eseguito come applicazione, le variabili si impostano con launchctl e poi l'applicazione deve essere riavviata. La guida all'ottimizzazione dei Mac Apple Silicon completa queste impostazioni sul versante macOS.

#MLX o Ollama su MacBook Air M3

MLX è il framework di machine learning di Apple per i suoi chip. È adatto agli sviluppatori che vogliono controllare il modello da Python o effettuare un fine-tuning LoRA in locale. Ollama, invece, si occupa del download, del caricamento e dell'API; è il punto di partenza più semplice. Le differenze di velocità tra i due dipendono dal modello e dalla versione: anziché promettere una percentuale, consulta il confronto dettagliato del sito.

#Serve passare a un MacBook Air M4 o superiore?

Il M4 porta la larghezza di banda a 120 GB/s secondo la tabella di llama.cpp, ovvero il 20% in più rispetto al M3: in questa tabella, un Llama 7B in Q4_0 passa da 21,34 a 24,11 token al secondo. Il miglioramento si nota sui modelli da 8B in su, ma non cambia radicalmente le prestazioni. Il vero limite del M3 rimane la memoria, non la velocità.

Quando tenere l'Air M3, quando cambiarlo
La tua situazioneRaccomandazione
Air M3 16 GB, uso per chat e sintesi con modelli da 8-9BMantienilo: il guadagno di un M4 è intorno al 20 % in velocità
Air M3 8 GB, voglio modelli da 8B e oltrePassa a 16 GB o più: la memoria è il limite
Hai bisogno di usare comodamente un modello da 24 a 32BUn Mac con maggiore banda passante e memoria (MacBook Pro, Mac mini M4 Pro)
Generazioni lunghe e continueUn Mac con ventilatore, per evitare la riduzione della frequenza

#Domande frequenti

FAQ
Il MacBook Air M3 può eseguire un LLM da 70B?+
No, non in modo utilizzabile. Un modello 70B in Q4 pesa circa 40 GB, ovvero ben più dei 24 GB massimi del MacBook Air M3. Anche con una quantizzazione molto aggressiva, non rientrerebbe nella memoria disponibile. Il limite ragionevole su questa macchina è un modello da 24 a 27B con 24 GB, ma lento, e un modello da 8-9B con 16 GB per un utilizzo fluido.
Che velocità aspettarsi su un MacBook Air M3?+
Su un Llama 7B in Q4_0, la tabella delle misurazioni di llama.cpp riporta 21,34 token al secondo per un M3 con 10 core GPU. Un modello più grande sarà più lento, un modello da 4B sarà circa due volte più veloce. Si tratta di misurazioni effettuate dagli utenti su un modello vecchio, da leggere come un ordine di grandezza.
MacBook Air M3 8 GB o MacBook Air M2 16 GB per l'IA locale?+
Il M2 da 16 GB, senza esitazione. I due chip hanno la stessa banda passante di 100 GB/s, quindi il M3 non genera più velocemente, mentre 16 GB permettono di caricare un modello da 8-9B che 8 GB non possono ospitare comodamente. La memoria è il criterio determinante.
È possibile utilizzare il Neural Engine per eseguire LLM?+
Non con gli strumenti comuni. Ollama, llama.cpp e LM Studio eseguono il modello sulla GPU tramite Metal. Il Neural Engine a 16 core serve soprattutto per attività di Core ML, come la visione o il riconoscimento vocale, e non è la strada per accelerare un LLM conversazionale su questo Mac.
Il MacBook Air M3 si riscalda troppo per l'IA locale?+
Non ha una ventola, quindi finisce per ridurre la frequenza durante le generazioni lunghe. Per domande brevi, non te ne accorgerai. Per attività lunghe, posizionalo su un supporto che dissipi il calore, collegalo alla corrente e scegli un modello più piccolo. Una macchina con una ventola è preferibile per un uso continuo.
Quale modello per programmare su un MacBook Air M3 con 16 GB?+
Un modello per la programmazione da 7 a 9 miliardi di parametri in Q4, circa 5–6 GB, lascia spazio al contesto dei tuoi file. Un 14B in Q4 (circa 9 GB) è un'opzione praticabile se accetti una velocità di generazione inferiore. Oltre queste dimensioni, il contesto lungo consuma il margine rimanente e la velocità diventa troppo bassa per la digitazione assistita.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.