Strumento · Apple Silicon da M1 a M6
Quale LLM può funzionare sul mio Mac ?
Scegli il tuo chip e la quantità di memoria: lo strumento elenca i modelli del catalogo che rientrano nella memoria disponibile, con la quantizzazione da usare e la velocità prevista.
Il tuo Mac
Caricamento del catalogo…
Cosa puoi eseguire in base alla memoria del tuo Mac
La memoria unificata è condivisa tra macOS e i modelli. Per impostazione predefinita, la GPU può utilizzarne circa due terzi fino a 32 GB, tre quarti oltre quel limite. Suggerimento: il modello più grande e più recente che rientra nella memoria disponibile in Q4 con un contesto di 8K.
| Memoria | Utilizzabile | Suggerimento (Q4) |
|---|---|---|
| 8 GB | ≈ 5,4 GB | LFM2.5 7B · classifica 8 GB |
| 16 GB | ≈ 11 GB | Nemotron 3 Super 12B · classifica per 16 GB |
| 24 GB | ≈ 16 GB | Devstral Small 2 24B · classifica per 24 GB |
| 32 GB | ≈ 21 GB | Laguna XS.2 · classifica 32 GB |
| 36 GB | ≈ 27 GB | Qwen 3.6 35B-A3B |
| 48 GB | ≈ 36 GB | Qwen 3.6 35B-A3B · classifica per 48 GB |
| 64 GB | ≈ 48 GB | Nemotron 3 Puzzle 75B-A9B · classifica 64 GB |
| 96 GB | ≈ 72 GB | Laguna S 2.1 · classifica 96 GB |
| 128 GB | ≈ 96 GB | Mistral Medium 3.5 128B · classifica 128 GB |
| 192 GB | ≈ 144 GB | MiniMax-M2.7 |
| 256 GB | ≈ 192 GB | GLM 5.3 Flash 320B-A18B |
| 512 GB | ≈ 384 GB | Nemotron 3 Ultra (BF16) |
La velocità dipende dal chip
A ogni parola generata, il Mac rilegge tutto il modello in memoria: la banda passante stabilisce quindi il limite di velocità. A parità di memoria, un chip Max o Ultra è diverse volte più veloce di un chip di base.
| Chip | Larghezza di banda | Memorie proposte |
|---|---|---|
| M1 | 68 GB/s | 8, 16 GB |
| M1 Pro | 200 GB/s | 16, 32 GB |
| M1 Max | 400 GB/s | 32, 64 GB |
| M1 Ultra | 800 GB/s | 64, 128 GB |
| M2 | 100 GB/s | 8, 16, 24 GB |
| M2 Pro | 200 GB/s | 16, 32 GB |
| M2 Max | 400 GB/s | 32, 64, 96 GB |
| M2 Ultra | 800 GB/s | 64, 128, 192 GB |
| M3 | 100 GB/s | 8, 16, 24 GB |
| M3 Pro | 150 GB/s | 18, 36 GB |
| M3 Max | Da 300 a 400 GB/s | 36, 48, 64, 96, 128 GB |
| M3 Ultra | 819 GB/s | 96, 256, 512 GB |
| M4 | 120 GB/s | 16, 24, 32 GB |
| M4 Pro | 273 GB/s | 24, 48, 64 GB |
| M4 Max | Da 410 a 546 GB/s | 36, 48, 64, 128 GB |
| M5 | 153 GB/s | 16, 24, 32 GB |
| M5 Pro | 307 GB/s | 24, 48, 64 GB |
| M5 Max | Da 460 a 614 GB/s | 36, 48, 64, 96, 128 GB |
| M5 Ultra | 1200 GB/s | 96, 256, 512 GB |
| M6 | 170 GB/s | 16, 24, 32 GB |
Due valori: la versione con meno core GPU (e meno memoria) ha una banda passante più bassa. Fonti: schede tecniche Apple; M5 e M6: le nostre schede Mac Studio M5 et Mac mini M6.
Domande frequenti
Un Mac con 8 GB può eseguire un LLM?
Sì, ma solo modelli piccoli: circa 5 GB sono utilizzabili dai modelli, lasciando spazio a un modello da 3 a 4 miliardi di parametri in Q4 (Qwen 3 4B, Gemma 3 4B). A partire da 16 GB, i modelli da 7-8B si possono usare agevolmente.
Quale parte della memoria unificata può utilizzare la GPU?
Per impostazione predefinita, macOS riserva circa un terzo della memoria al sistema sui Mac fino a 32 GB, un quarto oltre. Un Mac da 24 GB offre quindi circa 16 GB ai modelli, un Mac da 96 GB circa 72 GB. Il comando sysctl iogpu.wired_limit_mb permette di aumentare questo limite, lasciando abbastanza memoria a macOS.
Perché due Mac con la stessa memoria non hanno la stessa velocità?
Perché la velocità di generazione dipende soprattutto dalla larghezza di banda della memoria: 120 GB/s su un M4, 273 GB/s su un M4 Pro, 546 GB/s su un M4 Max. A ogni parola, la macchina rilegge tutto il modello. Un M4 Max è quindi circa 4 volte più veloce di un M4 con un modello che entra nella memoria di entrambi.
MLX, Ollama o LM Studio su Mac?
Funzionano tutti e tre. MLX, il framework di Apple, è spesso il più veloce su Apple Silicon; LM Studio lo propone con un'interfaccia grafica; Ollama è il più semplice da usare dalla riga di comando e si integra con molti strumenti.