Principiante 11 minMacBook Air

Quale LLM su MacBook Air M2 (8 / 16 / 24 GB) ?

Risposta diretta

Il MacBook Air M2 esegue modelli da 3 a 4 miliardi di parametri con 8 GB, da 8 a 9 miliardi con 16 GB e fino a un modello 24B in Q4 con 24 GB. La sua banda passante di 100 GB/s, il 50% in più rispetto all'M1 secondo Apple, limita la velocità di un modello 8B in Q4 a circa 20 token al secondo; la memoria determina ciò che si può caricare.

L'M2 è il primo chip del MacBook Air a offrire 24 GB e 100 GB/s. Questa pagina indica quale classe di modello scegliere in base a 8, 16 o 24 GB, calcola la velocità massima fisicamente possibile e indica quando passare all'M4.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#MacBook Air M2: banda passante di 100 GB/s e fino a 24 GB

Il MacBook Air M2 introduce rispetto all'M1 due cambiamenti importanti per un LLM: la banda passante sale a 100 GB/s e la memoria può raggiungere 24 GB. Apple dichiara 100 GB/s per l'M2, cioè il 50 % in più rispetto all'M1: è il dato ufficiale, non un aumento del 47 % come si legge talvolta. La velocità massima di generazione aumenta quindi di una quota compresa tra circa un terzo e la metà, a seconda del modello, e si passa a una categoria superiore di modelli utilizzabili.

Chip
Apple M2: CPU a 8 core (4 ad alte prestazioni, 4 ad alta efficienza), GPU a 8 core, oppure a 10 core nella configurazione superiore, Neural Engine a 16 core, secondo la scheda tecnica di Apple.
Memoria
Secondo la scheda Apple, i MacBook Air M2 sono disponibili con 8 GB (configurabili a 16 o 24 GB) e con 16 GB (configurabili a 24 GB). La memoria è saldata: la scelta si fa all'acquisto.
Larghezza di banda
100 GB/s, secondo Apple, cioè il 50% in più rispetto al M1.
Raffreddamento
Nessuna ventola: Apple descrive il MacBook Air M2 come un dispositivo dal design silenzioso e senza ventola. Il silenzio ha un prezzo sotto carico prolungato: vedi la sezione termica.
Batteria
52,6 Wh; Apple dichiara fino a 15 ore di navigazione web wireless. Un LLM che impegna la GPU consuma molto più di una pagina web.

#8, 16 o 24 GB: cosa permette ogni livello

Il kit Mac

Su un MacBook Air M2, ogni gigabyte conta. Il kit Mac ti aiuta a scegliere il modello che entra davvero nella memoria disponibile (cap. 4), a calcolare il tuo budget di memoria (cap. 5) e a misurare l'effetto sul calore e sulla batteria (cap. 6).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Un modello non può occupare tutta la memoria: macOS, il browser e le tue applicazioni ne riservano una parte. Considera uno spazio disponibile dell'ordine di 4–5 GB su 8 GB, di 10–11 GB su 16 GB e di 16–18 GB su 24 GB per il modello e il suo contesto. Sono stime prudenti, da confrontare con la pressione della memoria in Monitoraggio Attività. La dimensione di un modello segue i riferimenti del sito: circa 2 GB per 3B, circa 5 GB per 7–8B, circa 9 GB per 14B, circa 19–20 GB per 32B in Q4.

Air M2: classe di modelli realistica in base alla memoria (Q4_K_M)
MemoriaMargine per il modello e il contestoClasse di modelli eseguibile senza difficoltàAl limite
8 GB≈ 4–5 GB3-4B8B con contesto molto breve
16 GB≈ 10–11 GB8-9B, contesto medio12B con contesto breve
24 GB≈ 16–18 GB12-14B senza difficoltà, 8-9B in Q8 o con un contesto lungo24B in Q4 (≈ 14 GB) con contesto ridotto

La configurazione da 24 GB è quella che cambia la natura della macchina: permette di caricare modelli da 24 miliardi di parametri in Q4 (circa 14 GB di pesi), cosa che nessun Air M1 consente. È però rara: la memoria non è espandibile, quindi la maggior parte degli Air M2 in circolazione ha 8 o 16 GB. Prima di scegliere un modello, controlla nel menu Apple, «Informazioni su questo Mac», quanta memoria ha effettivamente la macchina.

→
16 GB: il livello che copre l'essenziale
Per riassunti, scrittura, assistenza nella programmazione e RAG leggero, un modello da 8 a 9 miliardi di parametri in Q4 basta per la maggior parte degli usi comuni. La versione da 24 GB si giustifica soprattutto se vuoi un modello da 24B, un contesto molto lungo o un embedder e un reranker in parallelo al modello di generazione.

#Velocità massima che il M2 può raggiungere

La generazione legge i pesi attivi a ogni token: la velocità massima è la banda passante divisa per il peso in gigabyte. La tabella seguente applica la formula al M2 (100 GB/s) e al M1 (circa 68 GB/s). Sono limiti massimi calcolati, mai misure: la velocità reale è più bassa e dipende dal motore, dalla quantizzazione e dalla lunghezza del contesto. Consentono di verificare che un valore dichiarato altrove sia fisicamente possibile.

Limite teorico di generazione (solo i pesi in Q4): calcolo, non misurazione
ModelloDimensione del modelloAir M1 (≈ 68 GB/s)Air M2 (100 GB/s)
3B≈ 2 GB≈ 34 tok/s≈ 50 tok/s
4B≈ 2,5–3 GB≈ 23–27 tok/s≈ 33–40 tok/s
8B≈ 5 GB≈ 13 tok/s≈ 20 tok/s
12B≈ 7,5 GB≈ 9 tok/s≈ 13 tok/s
24B≈ 14 GBnon applicabile (memoria)≈ 7 tok/s

Da questi dati emergono due conclusioni. Innanzitutto, un modello 8B in Q4 su M2 si colloca teoricamente sotto i 20 token al secondo: un valore indicato di 25 o 28 token al secondo per questo modello su questo chip non può derivare dalla generazione classica. Inoltre, un modello 24B raggiunge al massimo circa 7 token al secondo: è utilizzabile per una risposta ponderata, non per uno scambio rapido. Per misurazioni reali, consulta /benchmarks e i benchmark di terzi, verificando chip, quantizzazione e motore.

#Installare un modello e verificare la GPU

  1. 01
    Installare Ollama
    Scaricalo da ollama.com o con Homebrew. La guida all'installazione su macOS di questo sito illustra in dettaglio le opzioni di avvio.
  2. 02
    Scegliere il modello in base alla memoria
    4B su 8 GB, 8-9B su 16 GB, 12-14B o un 24B in Q4 su 24 GB. Avvialo con ollama run seguito dal nome del modello.
  3. 03
    Verificare la GPU
    In un altro terminale, ollama ps mostra la distribuzione CPU/GPU nella colonna PROCESSOR. È previsto che tutto sia sulla GPU.
  4. 04
    Regolare il contesto
    Ollama imposta il contesto predefinito a 4.000 token con meno di 24 GiB di memoria. Aumentalo gradualmente anziché tutto in una volta: la cache KV occupa memoria per ogni token.
Terminale
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

I modelli vengono installati in ~/.ollama/models. Su un Air M2 dotato di SSD da 256 GB, alcuni modelli da 5 a 15 GB sono sufficienti a riempire lo spazio libero: rimuovi quelli che non usi più con ollama rm.

Un criterio utile per scegliere: parti dal modello più piccolo che svolge correttamente il tuo compito, poi passa alla taglia successiva solo se le risposte restano insufficienti. Su una macchina con banda passante limitata, ogni miliardo di parametri aggiuntivo si paga in velocità. Prova due candidati su cinque delle tue richieste reali prima di decidere: richiede dieci minuti e ti evita di scaricare un modello troppo pesante.

#La versione da 24 GB e il RAG: cosa permette davvero questa capacità di memoria

Un assistente che lavora sui tuoi documenti richiede tre componenti: un modello di embedding che indicizza, un modello di generazione che risponde ed eventualmente un reranker che ordina i passaggi. Con 8 GB, lo spazio per l'insieme è limitato. Con 16 GB, un embedder leggero e un modello 8–9B possono coesistere con un contesto breve. Con 24 GB, puoi aggiungere un reranker e mantenere un contesto di diverse migliaia di token senza scrivere sull'SSD. È l'uso in cui il taglio di memoria superiore ha più senso.

Prima dell'indicizzazione
Verifica che il modello di embedding possa stare in memoria insieme al modello di generazione: entrambi rimangono caricati durante la richiesta.
Durante la richiesta
Inserisci pochi passaggi ben scelti anziché un documento intero: il contesto consuma memoria e richiede tempo di calcolo.
Dopo
Se la pressione sulla memoria passa al giallo, riduci il numero di passaggi o passa a un modello più piccolo.

#Quantizzazione e cache KV su M2

Su una macchina limitata dalla larghezza di banda, Q4_K_M resta l'impostazione predefinita: il modello è più piccolo, quindi più veloce da leggere. Q5_K_M è giustificato quando la memoria lo permette e la qualità è prioritaria. Q8_0 raddoppia quasi il peso e dimezza approssimativamente la velocità massima. Per la cache KV, Ollama utilizza automaticamente Flash Attention quando il motore e l'hardware lo permettono; la variabile OLLAMA_KV_CACHE_TYPE quantizza la cache, con f16 come impostazione predefinita. Questa quantizzazione rende i contesti lunghi più accessibili con 16 GB, al prezzo di una lieve perdita di precisione.

#Autonomia, silenziosità e calore

L'Air M2 non ha una ventola: rimane silenzioso, il che lo rende adatto a un ufficio tranquillo o a un assistente lasciato in esecuzione di notte. Lo chassis dissipa il calore passivamente, quindi un carico di diverse decine di minuti fa scendere la frequenza del chip. Questa pagina non indica né una durata né una temperatura di soglia: nessuna fonte primaria le stabilisce e variano in base all'ambiente. Quando funziona a batteria, l'autonomia diminuisce molto più rapidamente rispetto alla navigazione, perché la GPU lavora continuamente; per una sessione lunga, collegalo alla rete elettrica.

Elaborazioni lunghe
Collega il computer alla rete elettrica, tienilo sollevato ed evita le applicazioni che impegnano contemporaneamente il processore.
Modalità risparmio energetico
Su macOS è disponibile nelle impostazioni della batteria. Limita le prestazioni: riservalo agli spostamenti in cui l'autonomia è più importante della velocità.
Carico continuo
Per un server locale che risponde tutto il giorno, un Mac mini, dotato di ventola, è più adatto di un Air.

#Restare su M2 o passare a un M3, un M4?

Il M3 mantiene la stessa banda passante di 100 GB/s e lo stesso limite di 24 GB sull'Air, secondo le schede tecniche di Apple: per un LLM, passare da M2 a M3 non offre quasi nessun miglioramento misurabile nella generazione. Il M4 porta la banda passante a 120 GB/s e la memoria a 32 GB, cambiando sia la velocità massima sia la classe di modelli.

Air M2, M3 e M4: i punti chiave per un LLM locale, secondo le schede Apple
CriterioAir M2Air M3Air M4
Larghezza di banda100 GB/s100 GB/s120 GB/s
Memoria massima24 GB24 GB32 GB
DecisioneMantenere se hai 16 GB o 24 GBPochi motivi per passare dall'M2 a un modello successivoCambiare se vuoi più di 24 GB
Mantieni il tuo M2 da 16 o 24 GB
Copre 8-9B e 12-14B senza problemi; il M4 migliora la velocità massima solo di circa il 20 %.
Cambia se hai 8 GB
Il vantaggio riguarda la classe del modello, non la velocità: un Air con almeno 16 GB permette di passare dal 4B all'8-9B.
Cambia se vuoi più di 24 GB
Solo il M4 offre 32 GB sull'Air; per capacità superiori, considera il MacBook Pro M4 Pro o Max.

#Domande frequenti

FAQ
Un MacBook Air M2 da 8 GB può eseguire un modello 8B?+
Tecnicamente sì in Q4 (circa 5 GB di pesi), ma il margine da 4 a 5 GB lasciato da macOS viene superato non appena il contesto cresce: il sistema scrive quindi sull'SSD e tutto rallenta. Con 8 GB, resta su un modello da 3 a 4 miliardi di parametri e mantieni il contesto breve.
Qual è la vera differenza tra il MacBook Air M2 e il M3 per un LLM?+
Molto ridotta per la generazione: secondo le schede Apple, l'Air M3 offre la stessa larghezza di banda di 100 GB/s e lo stesso massimo di 24 GB di memoria. Il M3 introduce soprattutto altri miglioramenti, senza effetti diretti sulla velocità di lettura dei pesi. Se hai un M2, aspetta piuttosto il M4.
Vale la pena scegliere il MacBook Air M2 da 24 GB per l'IA locale?+
Sì, se vuoi un modello da 24 miliardi di parametri in Q4 (circa 14 GB) o un RAG con embedder e reranker: questi utilizzi non rientrano nei 16 GB disponibili. Altrimenti, 16 GB sono già sufficienti per i modelli da 8 a 9 miliardi di parametri. Verifica la memoria effettiva della macchina prima dell'acquisto.
A quale velocità gira un LLM 8B su MacBook Air M2?+
Il limite teorico è la banda passante divisa per il peso: 100 GB/s divisi per circa 5 GB danno al massimo 20 token al secondo per un modello 8B in Q4. La velocità reale è inferiore, a seconda del motore e del contesto. Consulta /benchmarks o misurazioni di terzi che specificano il chip e la quantizzazione.
Il ventilatore dell'Air M2 si accende con un modello grande?+
No: non c'è alcuna ventola. Apple descrive un design senza ventole, silenzioso. Il rovescio della medaglia è termico: sotto carico prolungato, il chip riduce la propria frequenza e la generazione rallenta senza rumore. Per elaborazioni di diverse ore, preferisci un Mac mini o un MacBook Pro.
Ollama o LM Studio su un Air M2?+
Ollama per iniziare rapidamente, scrivere script e integrarlo con altri strumenti; LM Studio per avere un'interfaccia grafica ed esplorare modelli Hugging Face. I due possono coesistere, ma non devono caricare due modelli contemporaneamente su macchine con 8 o 16 GB: la memoria è il principale fattore limitante.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.