Principiante 12 minMacBook Air

Quale LLM su MacBook Air M1 (8 / 16 GB) ?

Risposta diretta

Il MacBook Air M1 esegue modelli da 3 a 4 miliardi di parametri su 8 GB e da 8 a 9 miliardi su 16 GB, con quantizzazione Q4_K_M. Il limite non è la potenza di calcolo ma la memoria unificata (8 o 16 GB, non estendibile) e la banda passante di circa 68 GB/s, che limita un modello da 8B a una dozzina di token al secondo.

Il MacBook Air M1 resta un valido punto di partenza per l'IA locale, a condizione di scegliere la giusta classe di modello. Questa pagina decide al posto tuo in base alla memoria del tuo computer, calcola la velocità massima che la macchina può fisicamente raggiungere e segnala quando è il momento di passare ad altro.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#MacBook Air M1: ciò che la macchina offre veramente per un LLM

Per un LLM locale, il MacBook Air M1 si riassume in tre dati: la memoria unificata (8 GB di serie, 16 GB opzionali, non espandibile dopo l'acquisto), la larghezza di banda della memoria (circa 68 GB/s) e l'assenza di una ventola. La memoria determina cosa si può caricare, la larghezza di banda determina la velocità di generazione e il raffreddamento passivo determina per quanto tempo questa velocità si mantiene.

Chip
Apple M1 (2020): 8 core CPU (4 ad alte prestazioni, 4 ad alta efficienza), 7 o 8 core GPU a seconda della configurazione, Neural Engine a 16 core, secondo la scheda tecnica di Apple.
Memoria
8 GB di memoria unificata, configurabile a 16 GB. La CPU e la GPU attingono allo stesso bacino di memoria: non esiste una VRAM separata da sommare.
Larghezza di banda
Apple non la pubblica nella scheda tecnica dell'M1. Annuncia invece 100 GB/s per l'M2, cioè il 50 % in più rispetto all'M1: questo colloca l'M1 intorno ai 67–68 GB/s, cifra comunemente citata (LPDDR4X).
Raffreddamento
Nessuna ventola: Apple presenta il MacBook Air M1 come completamente silenzioso, qualunque sia l'attività. Il rovescio della medaglia riguarda la gestione del calore, vedi più sotto.
Batteria
Batteria da 49,9 Wh; l'inferenza prolungata la scarica molto più rapidamente della navigazione web su cui Apple basa le 15 ore di autonomia dichiarate.

Apple ha smesso da tempo di vendere questa macchina nuova. Si trova usata, ma i prezzi variano troppo per riportarli qui. Le pagine hardware del sito (/materiel-ia) offrono riferimenti aggiornati se sei indeciso tra un Air usato e una macchina più recente. Il Mac mini del 2020 monta lo stesso chip M1 e ha gli stessi limiti di memoria e banda passante; aggiunge però una ventola, che rende più stabile la velocità sotto carico prolungato.

#8 GB o 16 GB: cosa permette e cosa preclude la RAM

Il kit Mac

L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Con 8 GB, il sistema, il browser e le tue applicazioni condividono già lo stesso spazio del modello. Restano circa 4–5 GB per un LLM, contesto compreso: è una stima di buon senso, non una misurazione, perché macOS adatta il proprio consumo di memoria. Con 16 GB, il margine sale a circa 10–11 GB, aprendo la strada ai modelli da 8–9 miliardi di parametri.

Cosa può stare nella memoria di un Air M1 in base alla capacità disponibile (Q4_K_M, soli pesi secondo i valori di riferimento del sito, più il contesto)
ModelloPesi in Q4Air M1 8 GBAir M1 16 GB
3B (Granite 4.1 3B, Llama 3.2 3B)≈ da 2 a 2,5 GBComodoComodo
4B (Qwen 3.5 4B, Phi-4 mini)≈ 2,5–3 GBComodo, contesto breveComodo, contesto lungo
7-9B (Granite 4.1 8B, Qwen 3.5 9B)≈ 5–6 GBMemoria troppo risicata: swap probabileBuon compromesso
12B (Gemma 4 12B)≈ 7–8 GBNoLimite: solo contesti brevi
24B e oltre≥ 14 GBNoNo

La classifica dell'ultima riga non dipende dalla velocità ma da un limite rigido: un modello da 14 GB non entra in 16 GB una volta caricato il sistema. Se hai dubbi sulla dimensione esatta di un modello, il calcolatore VRAM del sito indica la memoria occupata in base alla quantizzazione e al contesto.

!
Lo swap è il vero segnale d'allarme
Quando macOS esaurisce la RAM disponibile, scrive sull'SSD: la generazione rallenta notevolmente e l'usura del disco aumenta. Apri Monitoraggio Attività, nella scheda Memoria: se la «pressione memoria» passa al giallo o al rosso durante la generazione, scegli un modello più piccolo o riduci il contesto. È più efficace che chiudere le schede una per una.

#Quali modelli scegliere a seconda dell'uso

L'M1 va valutato in base alla dimensione del modello, non alla sua marca. Con 8 GB, punta a un modello 3B o 4B in Q4_K_M: riassunti di testi, riscrittura, domande e risposte su un estratto, codice semplice. Con 16 GB, un modello da 8 a 9 miliardi di parametri offre un netto miglioramento nella precisione e nella capacità di seguire istruzioni lunghe, al prezzo di una generazione più lenta. I nomi dei modelli cambiano ogni mese: l'essenziale è tenere a mente la fascia dimensionale e consultare il catalogo del sito per la situazione attuale.

Scrittura, riassunto, traduzione
Un 4B su 8 GB, un 8-9B su 16 GB. La qualità della scrittura in francese dipende più dalla famiglia del modello che dalle sue dimensioni: prova due candidati sui tuoi testi.
Codice
Un 4B basta per funzioni brevi e spiegazioni; per un progetto completo, la memoria dell'Air M1 impone contesti brevi, quindi un assistente di codice locale rimane limitato.
Documenti e RAG
Un embedder leggero più un modello di generazione da 4B (8 GB) o 8-9B (16 GB). Il contesto inserito consuma memoria: mantieni pochi passaggi, ben scelti.
Visione
I modelli multimodali aggiungono l’encoder delle immagini alla memoria del modello. Con 8 GB, limitati ai modelli di piccole dimensioni; con 16 GB, funzionano ma lentamente.

#Quanti token al secondo: il limite teorico

Durante la generazione, il processore rilegge quasi tutti i pesi attivi del modello per ogni token prodotto. La velocità massima è quindi limitata dalla banda passante divisa per la dimensione dei pesi. Su un M1 con circa 68 GB/s, un modello che pesa 5 GB non può superare circa 13 token al secondo, indipendentemente dal numero di core GPU disponibili. Si tratta di un limite calcolato, non di una misura: la velocità effettiva è più bassa, perché il calcolo, la cache KV e il sistema consumano anche banda passante.

Limite teorico di generazione su Air M1 (≈ 68 GB/s, solo pesi in Q4): calcolo, non misurazione
ModelloPesi in Q4CalcoloTetto
3B≈ 2 GB68 ÷ 2≈ 34 tok/s
4B≈ 2,5–3 GB68 ÷ 2,5 à 3≈ 23–27 tok/s
8B≈ 5 GB68 ÷ 5≈ 13 tok/s
9B≈ 6 GB68 ÷ 6≈ 11 tok/s
12B≈ 7,5 GB68 ÷ 7,5≈ 9 tok/s

Questo calcolo funge da filtro. Ogni promessa di più di 30 token al secondo su un modello di 8 miliardi di parametri in Q4 su M1 è fisicamente incompatibile con la banda passante, a meno che non si tratti di un modello che combina esperti, di cui solo una frazione è attiva. Per misure reali, consulta la pagina /benchmarks del sito e i benchmark pubblicati da terzi, verificando il chip, la quantizzazione e il motore utilizzati.

i
Perché Q4 piuttosto che Q8 su M1
Un Q8 pesa quasi il doppio di un Q4: a parità di banda passante, genera a circa metà della velocità e occupa più memoria. Sui modelli da 8–9B, la perdita di qualità del Q4_K_M è generalmente modesta. La guida sulla quantizzazione spiega in dettaglio la scelta tra Q4, Q5 e Q8.

#Installare e verificare in pochi minuti

Ollama è la strada più semplice: installa il motore, scarica i modelli e rileva la GPU del Mac senza bisogno di configurazione. I modelli vengono salvati in ~/.ollama/models su macOS: considera diversi gigabyte per modello e tienilo presente se hai un SSD da 256 GB.

  1. 01
    Installare Ollama
    Scarica l'applicazione da ollama.com, oppure usa Homebrew con il comando seguente. Il tutorial di installazione macOS di questo sito spiega l'avvio automatico.
  2. 02
    Avviare un modello adatto alla RAM
    Con 8 GB, un modello 4B; con 16 GB, un modello 8-9B. Il primo avvio scarica il modello, quelli successivi sono immediati.
  3. 03
    Verificare che la GPU sia in uso
    In un secondo terminale, digita ollama ps: la colonna PROCESSOR deve indicare 100% GPU. Una ripartizione CPU/GPU segnala che il modello supera la capacità della memoria riservata alla GPU.
  4. 04
    Fissare il contesto
    Ollama sceglie un contesto predefinito in base alla memoria disponibile; sotto 24 GB, è di 4.000 token. Aumentalo solo se necessario: ogni token di contesto occupa memoria.
Terminale
brew install --cask ollama
ollama run qwen3.5:4b
ollama ps

LM Studio è l'alternativa con un'interfaccia grafica completa, utile se il terminale ti scoraggia. Consuma un po' più di memoria rispetto al solo Ollama, un aspetto che conta con 8 GB. MLX, il framework di Apple, sfrutta la memoria condivisa del Mac senza copie tra CPU e GPU; le impostazioni di MLX e llama.cpp sono trattate nella guida all'ottimizzazione di macOS.

#Il contesto lungo, la trappola degli 8 GB

Il peso del modello è solo una parte della memoria occupata. A ogni token di contesto si aggiunge una voce nella cache KV, che cresce con la lunghezza della conversazione. Ollama usa automaticamente la flash attention quando il motore e l'hardware lo consentono, limitando così questa crescita. Offre anche la possibilità di quantizzare la cache KV tramite la variabile OLLAMA_KV_CACHE_TYPE, il cui valore predefinito è f16. Su un Air M1 da 8 GB, questa opzione può fare la differenza tra un contesto di 4.000 token e uno di 8.000, al prezzo di una lieve perdita di precisione.

Terminale
# Quantifier le cache KV en q8_0 avant de démarrer le serveur
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

La guida sulla quantizzazione della cache KV spiega quando questa opzione vale la pena. La regola pratica: su 8 GB, mantieni il contesto breve e inietta solo i passaggi utili; su 16 GB, un contesto di 8 000 token rimane ragionevole con un modello da 8-9B.

#Il riscaldamento di un Air senza ventola

Senza ventola, il MacBook Air M1 dissipa il calore attraverso il telaio. Per un uso breve (una domanda, una risposta), nulla da segnalare. Durante un uso prolungato, come un'elaborazione in batch di diverse decine di minuti o l'indicizzazione di documenti, il chip riduce la propria frequenza per proteggersi: la velocità diminuisce senza che la macchina si arresti. Questa pagina non indica alcuna soglia in minuti o in gradi: dipende dall'ambiente e dal carico, e nessuna fonte affidabile la stabilisce.

Rialzare il computer
Un supporto per il computer migliora la circolazione dell'aria sotto lo chassis.
Chiudere le applicazioni pesanti
I browser con molti contenuti aperti e le applicazioni di videoconferenza utilizzano contemporaneamente risorse della CPU e scaldano lo stesso chip.
Preferire un modello più piccolo piuttosto che Q8
Meno memoria da rileggere, meno energia spesa per token.
Collegare l'alimentazione di rete per le attività lunghe
Quando funziona a batteria, macOS può limitare maggiormente le prestazioni. Dipende dalla modalità energetica scelta nelle impostazioni.

#Limiti e segnali per passare a un'altra macchina

Il M1 non è escluso per la sua età, ma per la memoria. I criteri che devono spingerti a cercare un'altra soluzione sono semplici e misurabili.

Vuoi un modello da più di 12B
Nessuna configurazione del MacBook Air M1 ha memoria sufficiente per ospitarlo comodamente. Considera il MacBook Air M4 (disponibile con 32 GB) o un MacBook Pro con chip Pro/Max.
Lavori su documenti di grandi dimensioni
Un contesto lungo esaurisce la memoria prima che si raggiunga il limite della potenza di calcolo. Più RAM è l'unico vero rimedio.
Avvii elaborazioni che durano diverse ore
Un Mac mini, che ha una ventola, o un PC fisso regge meglio un carico continuo.
Ti interessa il fine-tuning
Un Air M1 non è dimensionato per questo; preferisci un servizio cloud da usare occasionalmente.
Air M1 o generazione successiva: ciò che cambia per un LLM locale
CriterioMacBook Air M1MacBook Air M2MacBook Air M4
Memoria massima16 GB24 GB32 GB
Larghezza di banda≈ 68 GB/s100 GB/s120 GB/s
Modello utilizzabile agevolmente in Q48-9B8-9B, 14B in 24 GB14B, 24B in 32 GB

#Domande frequenti

FAQ
Un MacBook Air M1 8 GB basta per un LLM locale?+
Sì per modelli da 3 a 4 miliardi di parametri in Q4, che pesano circa 2–3 GB e lasciano margine al sistema. Un modello da 8 miliardi in Q4 (circa 5 GB) rimane possibile, ma spinge macOS a scrivere sull'SSD appena il contesto aumenta. Per un uso regolare, con 16 GB si lavora decisamente più comodamente.
Quale velocità aspettarsi da un LLM 8B su MacBook Air M1?+
Il limite teorico si calcola dividendo la banda passante (circa 68 GB/s) per il peso del modello: per un 8B in Q4 (circa 5 GB), si ottiene circa 13 token al secondo al massimo. La velocità reale è più bassa. Questo calcolo serve a escludere cifre irrealistiche, non a prevedere le prestazioni della tua macchina.
È possibile eseguire un 70B su un MacBook Air M1?+
No. Un modello con 70 miliardi di parametri pesa circa 40 GB in Q4, cioè più del doppio della memoria massima di un Air M1 (16 GB). Anche con una quantizzazione molto aggressiva, non si carica correttamente. Su questa macchina, la fascia di dimensioni realistica si limita a circa 8-12 miliardi di parametri.
Conviene scegliere Ollama, LM Studio o MLX su M1?+
Ollama per iniziare rapidamente e scrivere script, LM Studio se preferisci un'interfaccia grafica completa, MLX se vuoi sfruttare direttamente il framework di Apple da Python. Con 8 GB, il consumo aggiuntivo di memoria di un'interfaccia grafica conta: inizia con Ollama, poi cambia solo se emerge un'esigenza precisa.
Il MacBook Air M1 si riscalda molto con un LLM?+
Non ha una ventola, quindi si scalda e riduce la frequenza sotto carico prolungato. Negli scambi brevi, l'effetto è trascurabile. Per elaborazioni lunghe, tieni il computer rialzato, collegalo alla rete elettrica e preferisci un modello più piccolo. Se avvii attività che durano diverse ore, un Mac mini con ventola è più adatto.
Vale la pena passare a un Air M4 per l'IA locale?+
Sì, se la memoria è il tuo limite: l'Air M4 arriva a 32 GB e offre 120 GB/s di larghezza di banda contro circa 68 GB/s. Se continui a usare modelli da 4 a 8 miliardi di parametri per il testo, il M1 con 16 GB resta utilizzabile; il vantaggio del passaggio è quindi soprattutto la comodità d'uso.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.