Quale LLM su MacBook Air M1 (8 / 16 GB) ?
Il MacBook Air M1 esegue modelli da 3 a 4 miliardi di parametri su 8 GB e da 8 a 9 miliardi su 16 GB, con quantizzazione Q4_K_M. Il limite non è la potenza di calcolo ma la memoria unificata (8 o 16 GB, non estendibile) e la banda passante di circa 68 GB/s, che limita un modello da 8B a una dozzina di token al secondo.
Il MacBook Air M1 resta un valido punto di partenza per l'IA locale, a condizione di scegliere la giusta classe di modello. Questa pagina decide al posto tuo in base alla memoria del tuo computer, calcola la velocità massima che la macchina può fisicamente raggiungere e segnala quando è il momento di passare ad altro.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: MacBook Pro M5 Pro — 24 GB / 1 TB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#MacBook Air M1: ciò che la macchina offre veramente per un LLM
Per un LLM locale, il MacBook Air M1 si riassume in tre dati: la memoria unificata (8 GB di serie, 16 GB opzionali, non espandibile dopo l'acquisto), la larghezza di banda della memoria (circa 68 GB/s) e l'assenza di una ventola. La memoria determina cosa si può caricare, la larghezza di banda determina la velocità di generazione e il raffreddamento passivo determina per quanto tempo questa velocità si mantiene.
- Chip
- Apple M1 (2020): 8 core CPU (4 ad alte prestazioni, 4 ad alta efficienza), 7 o 8 core GPU a seconda della configurazione, Neural Engine a 16 core, secondo la scheda tecnica di Apple.
- Memoria
- 8 GB di memoria unificata, configurabile a 16 GB. La CPU e la GPU attingono allo stesso bacino di memoria: non esiste una VRAM separata da sommare.
- Larghezza di banda
- Apple non la pubblica nella scheda tecnica dell'M1. Annuncia invece 100 GB/s per l'M2, cioè il 50 % in più rispetto all'M1: questo colloca l'M1 intorno ai 67–68 GB/s, cifra comunemente citata (LPDDR4X).
- Raffreddamento
- Nessuna ventola: Apple presenta il MacBook Air M1 come completamente silenzioso, qualunque sia l'attività. Il rovescio della medaglia riguarda la gestione del calore, vedi più sotto.
- Batteria
- Batteria da 49,9 Wh; l'inferenza prolungata la scarica molto più rapidamente della navigazione web su cui Apple basa le 15 ore di autonomia dichiarate.
Apple ha smesso da tempo di vendere questa macchina nuova. Si trova usata, ma i prezzi variano troppo per riportarli qui. Le pagine hardware del sito (/materiel-ia) offrono riferimenti aggiornati se sei indeciso tra un Air usato e una macchina più recente. Il Mac mini del 2020 monta lo stesso chip M1 e ha gli stessi limiti di memoria e banda passante; aggiunge però una ventola, che rende più stabile la velocità sotto carico prolungato.
#8 GB o 16 GB: cosa permette e cosa preclude la RAM
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Con 8 GB, il sistema, il browser e le tue applicazioni condividono già lo stesso spazio del modello. Restano circa 4–5 GB per un LLM, contesto compreso: è una stima di buon senso, non una misurazione, perché macOS adatta il proprio consumo di memoria. Con 16 GB, il margine sale a circa 10–11 GB, aprendo la strada ai modelli da 8–9 miliardi di parametri.
| Modello | Pesi in Q4 | Air M1 8 GB | Air M1 16 GB |
|---|---|---|---|
| 3B (Granite 4.1 3B, Llama 3.2 3B) | ≈ da 2 a 2,5 GB | Comodo | Comodo |
| 4B (Qwen 3.5 4B, Phi-4 mini) | ≈ 2,5–3 GB | Comodo, contesto breve | Comodo, contesto lungo |
| 7-9B (Granite 4.1 8B, Qwen 3.5 9B) | ≈ 5–6 GB | Memoria troppo risicata: swap probabile | Buon compromesso |
| 12B (Gemma 4 12B) | ≈ 7–8 GB | No | Limite: solo contesti brevi |
| 24B e oltre | ≥ 14 GB | No | No |
La classifica dell'ultima riga non dipende dalla velocità ma da un limite rigido: un modello da 14 GB non entra in 16 GB una volta caricato il sistema. Se hai dubbi sulla dimensione esatta di un modello, il calcolatore VRAM del sito indica la memoria occupata in base alla quantizzazione e al contesto.
#Quali modelli scegliere a seconda dell'uso
L'M1 va valutato in base alla dimensione del modello, non alla sua marca. Con 8 GB, punta a un modello 3B o 4B in Q4_K_M: riassunti di testi, riscrittura, domande e risposte su un estratto, codice semplice. Con 16 GB, un modello da 8 a 9 miliardi di parametri offre un netto miglioramento nella precisione e nella capacità di seguire istruzioni lunghe, al prezzo di una generazione più lenta. I nomi dei modelli cambiano ogni mese: l'essenziale è tenere a mente la fascia dimensionale e consultare il catalogo del sito per la situazione attuale.
- Scrittura, riassunto, traduzione
- Un 4B su 8 GB, un 8-9B su 16 GB. La qualità della scrittura in francese dipende più dalla famiglia del modello che dalle sue dimensioni: prova due candidati sui tuoi testi.
- Codice
- Un 4B basta per funzioni brevi e spiegazioni; per un progetto completo, la memoria dell'Air M1 impone contesti brevi, quindi un assistente di codice locale rimane limitato.
- Documenti e RAG
- Un embedder leggero più un modello di generazione da 4B (8 GB) o 8-9B (16 GB). Il contesto inserito consuma memoria: mantieni pochi passaggi, ben scelti.
- Visione
- I modelli multimodali aggiungono l’encoder delle immagini alla memoria del modello. Con 8 GB, limitati ai modelli di piccole dimensioni; con 16 GB, funzionano ma lentamente.
#Quanti token al secondo: il limite teorico
Durante la generazione, il processore rilegge quasi tutti i pesi attivi del modello per ogni token prodotto. La velocità massima è quindi limitata dalla banda passante divisa per la dimensione dei pesi. Su un M1 con circa 68 GB/s, un modello che pesa 5 GB non può superare circa 13 token al secondo, indipendentemente dal numero di core GPU disponibili. Si tratta di un limite calcolato, non di una misura: la velocità effettiva è più bassa, perché il calcolo, la cache KV e il sistema consumano anche banda passante.
| Modello | Pesi in Q4 | Calcolo | Tetto |
|---|---|---|---|
| 3B | ≈ 2 GB | 68 ÷ 2 | ≈ 34 tok/s |
| 4B | ≈ 2,5–3 GB | 68 ÷ 2,5 à 3 | ≈ 23–27 tok/s |
| 8B | ≈ 5 GB | 68 ÷ 5 | ≈ 13 tok/s |
| 9B | ≈ 6 GB | 68 ÷ 6 | ≈ 11 tok/s |
| 12B | ≈ 7,5 GB | 68 ÷ 7,5 | ≈ 9 tok/s |
Questo calcolo funge da filtro. Ogni promessa di più di 30 token al secondo su un modello di 8 miliardi di parametri in Q4 su M1 è fisicamente incompatibile con la banda passante, a meno che non si tratti di un modello che combina esperti, di cui solo una frazione è attiva. Per misure reali, consulta la pagina /benchmarks del sito e i benchmark pubblicati da terzi, verificando il chip, la quantizzazione e il motore utilizzati.
#Installare e verificare in pochi minuti
Ollama è la strada più semplice: installa il motore, scarica i modelli e rileva la GPU del Mac senza bisogno di configurazione. I modelli vengono salvati in ~/.ollama/models su macOS: considera diversi gigabyte per modello e tienilo presente se hai un SSD da 256 GB.
- 01Installare OllamaScarica l'applicazione da ollama.com, oppure usa Homebrew con il comando seguente. Il tutorial di installazione macOS di questo sito spiega l'avvio automatico.
- 02Avviare un modello adatto alla RAMCon 8 GB, un modello 4B; con 16 GB, un modello 8-9B. Il primo avvio scarica il modello, quelli successivi sono immediati.
- 03Verificare che la GPU sia in usoIn un secondo terminale, digita ollama ps: la colonna PROCESSOR deve indicare 100% GPU. Una ripartizione CPU/GPU segnala che il modello supera la capacità della memoria riservata alla GPU.
- 04Fissare il contestoOllama sceglie un contesto predefinito in base alla memoria disponibile; sotto 24 GB, è di 4.000 token. Aumentalo solo se necessario: ogni token di contesto occupa memoria.
LM Studio è l'alternativa con un'interfaccia grafica completa, utile se il terminale ti scoraggia. Consuma un po' più di memoria rispetto al solo Ollama, un aspetto che conta con 8 GB. MLX, il framework di Apple, sfrutta la memoria condivisa del Mac senza copie tra CPU e GPU; le impostazioni di MLX e llama.cpp sono trattate nella guida all'ottimizzazione di macOS.
#Il contesto lungo, la trappola degli 8 GB
Il peso del modello è solo una parte della memoria occupata. A ogni token di contesto si aggiunge una voce nella cache KV, che cresce con la lunghezza della conversazione. Ollama usa automaticamente la flash attention quando il motore e l'hardware lo consentono, limitando così questa crescita. Offre anche la possibilità di quantizzare la cache KV tramite la variabile OLLAMA_KV_CACHE_TYPE, il cui valore predefinito è f16. Su un Air M1 da 8 GB, questa opzione può fare la differenza tra un contesto di 4.000 token e uno di 8.000, al prezzo di una lieve perdita di precisione.
La guida sulla quantizzazione della cache KV spiega quando questa opzione vale la pena. La regola pratica: su 8 GB, mantieni il contesto breve e inietta solo i passaggi utili; su 16 GB, un contesto di 8 000 token rimane ragionevole con un modello da 8-9B.
#Il riscaldamento di un Air senza ventola
Senza ventola, il MacBook Air M1 dissipa il calore attraverso il telaio. Per un uso breve (una domanda, una risposta), nulla da segnalare. Durante un uso prolungato, come un'elaborazione in batch di diverse decine di minuti o l'indicizzazione di documenti, il chip riduce la propria frequenza per proteggersi: la velocità diminuisce senza che la macchina si arresti. Questa pagina non indica alcuna soglia in minuti o in gradi: dipende dall'ambiente e dal carico, e nessuna fonte affidabile la stabilisce.
- Rialzare il computer
- Un supporto per il computer migliora la circolazione dell'aria sotto lo chassis.
- Chiudere le applicazioni pesanti
- I browser con molti contenuti aperti e le applicazioni di videoconferenza utilizzano contemporaneamente risorse della CPU e scaldano lo stesso chip.
- Preferire un modello più piccolo piuttosto che Q8
- Meno memoria da rileggere, meno energia spesa per token.
- Collegare l'alimentazione di rete per le attività lunghe
- Quando funziona a batteria, macOS può limitare maggiormente le prestazioni. Dipende dalla modalità energetica scelta nelle impostazioni.
#Limiti e segnali per passare a un'altra macchina
Il M1 non è escluso per la sua età, ma per la memoria. I criteri che devono spingerti a cercare un'altra soluzione sono semplici e misurabili.
- Vuoi un modello da più di 12B
- Nessuna configurazione del MacBook Air M1 ha memoria sufficiente per ospitarlo comodamente. Considera il MacBook Air M4 (disponibile con 32 GB) o un MacBook Pro con chip Pro/Max.
- Lavori su documenti di grandi dimensioni
- Un contesto lungo esaurisce la memoria prima che si raggiunga il limite della potenza di calcolo. Più RAM è l'unico vero rimedio.
- Avvii elaborazioni che durano diverse ore
- Un Mac mini, che ha una ventola, o un PC fisso regge meglio un carico continuo.
- Ti interessa il fine-tuning
- Un Air M1 non è dimensionato per questo; preferisci un servizio cloud da usare occasionalmente.
| Criterio | MacBook Air M1 | MacBook Air M2 | MacBook Air M4 |
|---|---|---|---|
| Memoria massima | 16 GB | 24 GB | 32 GB |
| Larghezza di banda | ≈ 68 GB/s | 100 GB/s | 120 GB/s |
| Modello utilizzabile agevolmente in Q4 | 8-9B | 8-9B, 14B in 24 GB | 14B, 24B in 32 GB |
- MacBook Air M2: 24 GB e 100 GB/s di banda
- MacBook Air M4: fino a 32 GB di memoria
- Installa Ollama su macOS, passo dopo passo
- Quantizzare la cache KV per risparmiare memoria
- Quale LLM per 8 GB di memoria
- Calcolatore VRAM del sito
- Fonte: scheda tecnica Apple del MacBook Air M1
- Fonte: Apple, annuncio del chip M2 (banda passante)
- Fonte: documentazione Ollama, lunghezza del contesto
- Fonte: FAQ di Ollama, GPU, cache KV e Flash Attention
#Domande frequenti
Un MacBook Air M1 8 GB basta per un LLM locale?+
Quale velocità aspettarsi da un LLM 8B su MacBook Air M1?+
È possibile eseguire un 70B su un MacBook Air M1?+
Conviene scegliere Ollama, LM Studio o MLX su M1?+
Il MacBook Air M1 si riscalda molto con un LLM?+
Vale la pena passare a un Air M4 per l'IA locale?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.