◆ Mac — L'IA locale sul tuo Mac, al massimo — memoria unificata, MLX, il modello giusto per il tuo chip · 24 € · o tutti i kit 49 € →

Strumento · Apple Silicon da M1 a M6

Quale LLM può funzionare sul mio Mac ?

Scegli il tuo chip e la quantità di memoria: lo strumento elenca i modelli del catalogo che rientrano nella memoria disponibile, con la quantizzazione da usare e la velocità prevista.

Il tuo Mac

Caricamento del catalogo…

Cosa puoi eseguire in base alla memoria del tuo Mac

La memoria unificata è condivisa tra macOS e i modelli. Per impostazione predefinita, la GPU può utilizzarne circa due terzi fino a 32 GB, tre quarti oltre quel limite. Suggerimento: il modello più grande e più recente che rientra nella memoria disponibile in Q4 con un contesto di 8K.

MemoriaUtilizzabileSuggerimento (Q4)
8 GB≈ 5,4 GBLFM2.5 7B · classifica 8 GB
16 GB≈ 11 GBNemotron 3 Super 12B · classifica per 16 GB
24 GB≈ 16 GBDevstral Small 2 24B · classifica per 24 GB
32 GB≈ 21 GBLaguna XS.2 · classifica 32 GB
36 GB≈ 27 GBQwen 3.6 35B-A3B
48 GB≈ 36 GBQwen 3.6 35B-A3B · classifica per 48 GB
64 GB≈ 48 GBNemotron 3 Puzzle 75B-A9B · classifica 64 GB
96 GB≈ 72 GBLaguna S 2.1 · classifica 96 GB
128 GB≈ 96 GBMistral Medium 3.5 128B · classifica 128 GB
192 GB≈ 144 GBMiniMax-M2.7
256 GB≈ 192 GBGLM 5.3 Flash 320B-A18B
512 GB≈ 384 GBNemotron 3 Ultra (BF16)

La velocità dipende dal chip

A ogni parola generata, il Mac rilegge tutto il modello in memoria: la banda passante stabilisce quindi il limite di velocità. A parità di memoria, un chip Max o Ultra è diverse volte più veloce di un chip di base.

ChipLarghezza di bandaMemorie proposte
M168 GB/s8, 16 GB
M1 Pro200 GB/s16, 32 GB
M1 Max400 GB/s32, 64 GB
M1 Ultra800 GB/s64, 128 GB
M2100 GB/s8, 16, 24 GB
M2 Pro200 GB/s16, 32 GB
M2 Max400 GB/s32, 64, 96 GB
M2 Ultra800 GB/s64, 128, 192 GB
M3100 GB/s8, 16, 24 GB
M3 Pro150 GB/s18, 36 GB
M3 MaxDa 300 a 400 GB/s36, 48, 64, 96, 128 GB
M3 Ultra819 GB/s96, 256, 512 GB
M4120 GB/s16, 24, 32 GB
M4 Pro273 GB/s24, 48, 64 GB
M4 MaxDa 410 a 546 GB/s36, 48, 64, 128 GB
M5153 GB/s16, 24, 32 GB
M5 Pro307 GB/s24, 48, 64 GB
M5 MaxDa 460 a 614 GB/s36, 48, 64, 96, 128 GB
M5 Ultra1200 GB/s96, 256, 512 GB
M6170 GB/s16, 24, 32 GB

Due valori: la versione con meno core GPU (e meno memoria) ha una banda passante più bassa. Fonti: schede tecniche Apple; M5 e M6: le nostre schede Mac Studio M5 et Mac mini M6.

Domande frequenti

Un Mac con 8 GB può eseguire un LLM?

Sì, ma solo modelli piccoli: circa 5 GB sono utilizzabili dai modelli, lasciando spazio a un modello da 3 a 4 miliardi di parametri in Q4 (Qwen 3 4B, Gemma 3 4B). A partire da 16 GB, i modelli da 7-8B si possono usare agevolmente.

Quale parte della memoria unificata può utilizzare la GPU?

Per impostazione predefinita, macOS riserva circa un terzo della memoria al sistema sui Mac fino a 32 GB, un quarto oltre. Un Mac da 24 GB offre quindi circa 16 GB ai modelli, un Mac da 96 GB circa 72 GB. Il comando sysctl iogpu.wired_limit_mb permette di aumentare questo limite, lasciando abbastanza memoria a macOS.

Perché due Mac con la stessa memoria non hanno la stessa velocità?

Perché la velocità di generazione dipende soprattutto dalla larghezza di banda della memoria: 120 GB/s su un M4, 273 GB/s su un M4 Pro, 546 GB/s su un M4 Max. A ogni parola, la macchina rilegge tutto il modello. Un M4 Max è quindi circa 4 volte più veloce di un M4 con un modello che entra nella memoria di entrambi.

MLX, Ollama o LM Studio su Mac?

Funzionano tutti e tre. MLX, il framework di Apple, è spesso il più veloce su Apple Silicon; LM Studio lo propone con un'interfaccia grafica; Ollama è il più semplice da usare dalla riga di comando e si integra con molti strumenti.

Altri strumenti gratuiti