Quale LLM su MacBook Air M2 (8 / 16 / 24 GB) ?
Il MacBook Air M2 esegue modelli da 3 a 4 miliardi di parametri con 8 GB, da 8 a 9 miliardi con 16 GB e fino a un modello 24B in Q4 con 24 GB. La sua banda passante di 100 GB/s, il 50% in più rispetto all'M1 secondo Apple, limita la velocità di un modello 8B in Q4 a circa 20 token al secondo; la memoria determina ciò che si può caricare.
L'M2 è il primo chip del MacBook Air a offrire 24 GB e 100 GB/s. Questa pagina indica quale classe di modello scegliere in base a 8, 16 o 24 GB, calcola la velocità massima fisicamente possibile e indica quando passare all'M4.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#MacBook Air M2: banda passante di 100 GB/s e fino a 24 GB
Il MacBook Air M2 introduce rispetto all'M1 due cambiamenti importanti per un LLM: la banda passante sale a 100 GB/s e la memoria può raggiungere 24 GB. Apple dichiara 100 GB/s per l'M2, cioè il 50 % in più rispetto all'M1: è il dato ufficiale, non un aumento del 47 % come si legge talvolta. La velocità massima di generazione aumenta quindi di una quota compresa tra circa un terzo e la metà, a seconda del modello, e si passa a una categoria superiore di modelli utilizzabili.
- Chip
- Apple M2: CPU a 8 core (4 ad alte prestazioni, 4 ad alta efficienza), GPU a 8 core, oppure a 10 core nella configurazione superiore, Neural Engine a 16 core, secondo la scheda tecnica di Apple.
- Memoria
- Secondo la scheda Apple, i MacBook Air M2 sono disponibili con 8 GB (configurabili a 16 o 24 GB) e con 16 GB (configurabili a 24 GB). La memoria è saldata: la scelta si fa all'acquisto.
- Larghezza di banda
- 100 GB/s, secondo Apple, cioè il 50% in più rispetto al M1.
- Raffreddamento
- Nessuna ventola: Apple descrive il MacBook Air M2 come un dispositivo dal design silenzioso e senza ventola. Il silenzio ha un prezzo sotto carico prolungato: vedi la sezione termica.
- Batteria
- 52,6 Wh; Apple dichiara fino a 15 ore di navigazione web wireless. Un LLM che impegna la GPU consuma molto più di una pagina web.
#8, 16 o 24 GB: cosa permette ogni livello
Su un MacBook Air M2, ogni gigabyte conta. Il kit Mac ti aiuta a scegliere il modello che entra davvero nella memoria disponibile (cap. 4), a calcolare il tuo budget di memoria (cap. 5) e a misurare l'effetto sul calore e sulla batteria (cap. 6).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Un modello non può occupare tutta la memoria: macOS, il browser e le tue applicazioni ne riservano una parte. Considera uno spazio disponibile dell'ordine di 4–5 GB su 8 GB, di 10–11 GB su 16 GB e di 16–18 GB su 24 GB per il modello e il suo contesto. Sono stime prudenti, da confrontare con la pressione della memoria in Monitoraggio Attività. La dimensione di un modello segue i riferimenti del sito: circa 2 GB per 3B, circa 5 GB per 7–8B, circa 9 GB per 14B, circa 19–20 GB per 32B in Q4.
| Memoria | Margine per il modello e il contesto | Classe di modelli eseguibile senza difficoltà | Al limite |
|---|---|---|---|
| 8 GB | ≈ 4–5 GB | 3-4B | 8B con contesto molto breve |
| 16 GB | ≈ 10–11 GB | 8-9B, contesto medio | 12B con contesto breve |
| 24 GB | ≈ 16–18 GB | 12-14B senza difficoltà, 8-9B in Q8 o con un contesto lungo | 24B in Q4 (≈ 14 GB) con contesto ridotto |
La configurazione da 24 GB è quella che cambia la natura della macchina: permette di caricare modelli da 24 miliardi di parametri in Q4 (circa 14 GB di pesi), cosa che nessun Air M1 consente. È però rara: la memoria non è espandibile, quindi la maggior parte degli Air M2 in circolazione ha 8 o 16 GB. Prima di scegliere un modello, controlla nel menu Apple, «Informazioni su questo Mac», quanta memoria ha effettivamente la macchina.
#Velocità massima che il M2 può raggiungere
La generazione legge i pesi attivi a ogni token: la velocità massima è la banda passante divisa per il peso in gigabyte. La tabella seguente applica la formula al M2 (100 GB/s) e al M1 (circa 68 GB/s). Sono limiti massimi calcolati, mai misure: la velocità reale è più bassa e dipende dal motore, dalla quantizzazione e dalla lunghezza del contesto. Consentono di verificare che un valore dichiarato altrove sia fisicamente possibile.
| Modello | Dimensione del modello | Air M1 (≈ 68 GB/s) | Air M2 (100 GB/s) |
|---|---|---|---|
| 3B | ≈ 2 GB | ≈ 34 tok/s | ≈ 50 tok/s |
| 4B | ≈ 2,5–3 GB | ≈ 23–27 tok/s | ≈ 33–40 tok/s |
| 8B | ≈ 5 GB | ≈ 13 tok/s | ≈ 20 tok/s |
| 12B | ≈ 7,5 GB | ≈ 9 tok/s | ≈ 13 tok/s |
| 24B | ≈ 14 GB | non applicabile (memoria) | ≈ 7 tok/s |
Da questi dati emergono due conclusioni. Innanzitutto, un modello 8B in Q4 su M2 si colloca teoricamente sotto i 20 token al secondo: un valore indicato di 25 o 28 token al secondo per questo modello su questo chip non può derivare dalla generazione classica. Inoltre, un modello 24B raggiunge al massimo circa 7 token al secondo: è utilizzabile per una risposta ponderata, non per uno scambio rapido. Per misurazioni reali, consulta /benchmarks e i benchmark di terzi, verificando chip, quantizzazione e motore.
#Installare un modello e verificare la GPU
- 01Installare OllamaScaricalo da ollama.com o con Homebrew. La guida all'installazione su macOS di questo sito illustra in dettaglio le opzioni di avvio.
- 02Scegliere il modello in base alla memoria4B su 8 GB, 8-9B su 16 GB, 12-14B o un 24B in Q4 su 24 GB. Avvialo con ollama run seguito dal nome del modello.
- 03Verificare la GPUIn un altro terminale, ollama ps mostra la distribuzione CPU/GPU nella colonna PROCESSOR. È previsto che tutto sia sulla GPU.
- 04Regolare il contestoOllama imposta il contesto predefinito a 4.000 token con meno di 24 GiB di memoria. Aumentalo gradualmente anziché tutto in una volta: la cache KV occupa memoria per ogni token.
I modelli vengono installati in ~/.ollama/models. Su un Air M2 dotato di SSD da 256 GB, alcuni modelli da 5 a 15 GB sono sufficienti a riempire lo spazio libero: rimuovi quelli che non usi più con ollama rm.
Un criterio utile per scegliere: parti dal modello più piccolo che svolge correttamente il tuo compito, poi passa alla taglia successiva solo se le risposte restano insufficienti. Su una macchina con banda passante limitata, ogni miliardo di parametri aggiuntivo si paga in velocità. Prova due candidati su cinque delle tue richieste reali prima di decidere: richiede dieci minuti e ti evita di scaricare un modello troppo pesante.
#La versione da 24 GB e il RAG: cosa permette davvero questa capacità di memoria
Un assistente che lavora sui tuoi documenti richiede tre componenti: un modello di embedding che indicizza, un modello di generazione che risponde ed eventualmente un reranker che ordina i passaggi. Con 8 GB, lo spazio per l'insieme è limitato. Con 16 GB, un embedder leggero e un modello 8–9B possono coesistere con un contesto breve. Con 24 GB, puoi aggiungere un reranker e mantenere un contesto di diverse migliaia di token senza scrivere sull'SSD. È l'uso in cui il taglio di memoria superiore ha più senso.
- Prima dell'indicizzazione
- Verifica che il modello di embedding possa stare in memoria insieme al modello di generazione: entrambi rimangono caricati durante la richiesta.
- Durante la richiesta
- Inserisci pochi passaggi ben scelti anziché un documento intero: il contesto consuma memoria e richiede tempo di calcolo.
- Dopo
- Se la pressione sulla memoria passa al giallo, riduci il numero di passaggi o passa a un modello più piccolo.
#Quantizzazione e cache KV su M2
Su una macchina limitata dalla larghezza di banda, Q4_K_M resta l'impostazione predefinita: il modello è più piccolo, quindi più veloce da leggere. Q5_K_M è giustificato quando la memoria lo permette e la qualità è prioritaria. Q8_0 raddoppia quasi il peso e dimezza approssimativamente la velocità massima. Per la cache KV, Ollama utilizza automaticamente Flash Attention quando il motore e l'hardware lo permettono; la variabile OLLAMA_KV_CACHE_TYPE quantizza la cache, con f16 come impostazione predefinita. Questa quantizzazione rende i contesti lunghi più accessibili con 16 GB, al prezzo di una lieve perdita di precisione.
#Autonomia, silenziosità e calore
L'Air M2 non ha una ventola: rimane silenzioso, il che lo rende adatto a un ufficio tranquillo o a un assistente lasciato in esecuzione di notte. Lo chassis dissipa il calore passivamente, quindi un carico di diverse decine di minuti fa scendere la frequenza del chip. Questa pagina non indica né una durata né una temperatura di soglia: nessuna fonte primaria le stabilisce e variano in base all'ambiente. Quando funziona a batteria, l'autonomia diminuisce molto più rapidamente rispetto alla navigazione, perché la GPU lavora continuamente; per una sessione lunga, collegalo alla rete elettrica.
- Elaborazioni lunghe
- Collega il computer alla rete elettrica, tienilo sollevato ed evita le applicazioni che impegnano contemporaneamente il processore.
- Modalità risparmio energetico
- Su macOS è disponibile nelle impostazioni della batteria. Limita le prestazioni: riservalo agli spostamenti in cui l'autonomia è più importante della velocità.
- Carico continuo
- Per un server locale che risponde tutto il giorno, un Mac mini, dotato di ventola, è più adatto di un Air.
#Restare su M2 o passare a un M3, un M4?
Il M3 mantiene la stessa banda passante di 100 GB/s e lo stesso limite di 24 GB sull'Air, secondo le schede tecniche di Apple: per un LLM, passare da M2 a M3 non offre quasi nessun miglioramento misurabile nella generazione. Il M4 porta la banda passante a 120 GB/s e la memoria a 32 GB, cambiando sia la velocità massima sia la classe di modelli.
| Criterio | Air M2 | Air M3 | Air M4 |
|---|---|---|---|
| Larghezza di banda | 100 GB/s | 100 GB/s | 120 GB/s |
| Memoria massima | 24 GB | 24 GB | 32 GB |
| Decisione | Mantenere se hai 16 GB o 24 GB | Pochi motivi per passare dall'M2 a un modello successivo | Cambiare se vuoi più di 24 GB |
- Mantieni il tuo M2 da 16 o 24 GB
- Copre 8-9B e 12-14B senza problemi; il M4 migliora la velocità massima solo di circa il 20 %.
- Cambia se hai 8 GB
- Il vantaggio riguarda la classe del modello, non la velocità: un Air con almeno 16 GB permette di passare dal 4B all'8-9B.
- Cambia se vuoi più di 24 GB
- Solo il M4 offre 32 GB sull'Air; per capacità superiori, considera il MacBook Pro M4 Pro o Max.
- MacBook Air M1: i limiti a 8 e 16 GB
- MacBook Air M3: sempre 100 GB/s
- MacBook Air M4: 32 GB e 120 GB/s
- Installare Ollama su macOS
- MacBook Pro M4 Pro e Max, fino a 128 GB
- Calcolatore VRAM del sito
- Fonte: scheda tecnica Apple del MacBook Air M2
- Fonte: Apple, annuncio del chip M2
- Fonte: scheda tecnica Apple del MacBook Air M4
- Fonte: documentazione Ollama, contesto
#Domande frequenti
Un MacBook Air M2 da 8 GB può eseguire un modello 8B?+
Qual è la vera differenza tra il MacBook Air M2 e il M3 per un LLM?+
Vale la pena scegliere il MacBook Air M2 da 24 GB per l'IA locale?+
A quale velocità gira un LLM 8B su MacBook Air M2?+
Il ventilatore dell'Air M2 si accende con un modello grande?+
Ollama o LM Studio su un Air M2?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.