Quale LLM su Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB) ?
Il Mac Studio (M2 Ultra, M3 Ultra, M4 Max) nel 2026 è l'unico computer al mondo destinato al grande pubblico capace di eseguire localmente modelli con più di 200 miliardi di parametri. L'M3 Ultra da 512 GB (uscito all'inizio del 2025, sostituito alla fine di settembre 2026 dall'M5 Ultra) ha portato la memoria unificata a 512 GB per circa 11.000 € — abbastanza per Llama 4 Maverick 402B in Q4 o DeepSeek V3 671B in Q4. Questa guida descrive in dettaglio ogni configurazione e i relativi casi d'uso.
Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda Mac Studio M5 Max →
Alternativa d'acquisto per questa guida: Mac Studio M5 Max (36 GB / 512 GB).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su Mac Studio M5 Max (36 GB / 512 GB) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Mac Studio nel 2026
- Mac Studio M2 Ultra (2023)
- 24 core CPU + 60 o 76 core GPU, 800 GB/s, RAM 64/128/192 GB. Tuttora disponibile di seconda mano a partire da 2800 €.
- Mac Studio M4 Max (2025)
- 16 core CPU + 40 core GPU, 546 GB/s, RAM 36-128 GB. Sostituisce il M2 Max. Non è più venduto nuovo da Apple: sostituito a fine settembre 2026 dal M5 Max (a partire da 2.999 €).
- Mac Studio M3 Ultra (2025)
- 28 core CPU + 60 o 80 core GPU, 800 GB/s, RAM 96/256/512 GB. Il mostro. Venduto da 4499 € (96 GB) a 11 299 € (512 GB) fino all'arrivo del M5 Ultra; non più nel catalogo Apple a fine settembre 2026 (usato o scorte residue).
- Consumo
- 15 W a riposo, 70-130 W durante l'inferenza a seconda della configurazione. Il M3 Ultra con 512 GB raggiunge un picco di circa 150 W con un modello da 405B.
#1. M2 Ultra vs M3 Ultra vs M4 Max
- M4 Max
- Versione di base del Mac Studio. 546 GB/s, massimo 128 GB. Meglio di un MBP M4 Max: nessun throttling, prezzo inferiore (formato desktop).
- M2 Ultra
- Prima generazione Ultra. 800 GB/s, fino a 192 GB. Usato tra 2800 e 4500 €. Ancora competitivo per i modelli da 70B a 123B.
- M3 Ultra
- L'Ultra più recente (2025). 800 GB/s, come l'M2 Ultra, ma con architettura M3 (+20% in pratica). Da 96 a 512 GB di RAM. Per chi vuole superare i 200B.
#2. Fin dove spingersi con la RAM?
- 96 GB (M3 Ultra base)
- 4499 € a listino per il M3 Ultra, non più venduto nuovo (M5 Ultra 96 GB: 6 599 €). Fa girare gpt-oss 120B (MXFP4, 63 GB) a ~50 tok/s e i MoE ~30B (Qwen 3.6 35B-A3B) a ~70 tok/s, con margine per un contesto lungo. Punto ottimale per i grandi MoE fino a ~120B.
- 256 GB (M3 Ultra + 256)
- 7299 € nel listino del M3 Ultra, non più venduto nuovo. Permette di caricare Llama 4 Maverick 402B Q4 (230 GB) a ~34 tok/s e DeepSeek V3 671B Q2 (~240 GB). Per chi vuole modelli da 400B in su.
- 512 GB (M3 Ultra max)
- 11 299 € nel listino del M3 Ultra, non più venduto nuovo (M5 Ultra 512 GB: fine ottobre 2026). DeepSeek V3 671B Q4 (380 GB) ci sta, Qwen3-235B-A22B in Q8, contesto 128k+ sui grandi MoE. Ambito ricerca/R&D.
- 192 GB (M2 Ultra max)
- Carica Qwen3-235B-A22B Q4 (133 GB) e Maverick 402B in Q3. Equivalente funzionale all'M3 Ultra da 256 GB, a un prezzo un po' più basso sul mercato dell'usato. Buon compromesso.
#3. Modelli esclusivi per Ultra
| Modello | Quant | RAM richiesta | M2 Ultra 192 | M3 Ultra 256 | M3 Ultra 512 |
|---|---|---|---|---|---|
| gpt-oss 120B | MXFP4 | 63 GB | ✓ 42 t/s | ✓ 50 t/s | ✓ 50 t/s |
| Qwen3-235B-A22B | Q4_K_M | 133 GB | ✓ 26 t/s | ✓ 30 t/s | ✓ 30 t/s |
| Llama 4 Maverick 402B | Q4_K_M | 230 GB | — | ✓ 34 t/s | ✓ 34 t/s |
| Llama 4 Maverick 402B | Q8_0 | 410 GB | — | — | ✓ 22 t/s |
| DeepSeek V3 671B | Q2_K | 240 GB | — | ✓ 20 t/s | ✓ 20 t/s |
| DeepSeek V3 671B | Q4_K_M | 380 GB | — | — | ✓ 16 t/s |
#4. Benchmark 120B, 235B, 671B
| Modello | Q4_K_M | Q5_K_M | Q6_K | Flash Attn 16k |
|---|---|---|---|---|
| gpt-oss 120B | 50 t/s | — | — | 48 t/s |
| Qwen3-235B-A22B | 30 t/s | 28 t/s | 26 t/s | 27 t/s |
| Llama 4 Maverick 402B | 34 t/s | 30 t/s | 28 t/s | 31 t/s |
| DeepSeek V3 671B | 16 t/s | 14 t/s | — | 15 t/s |
#5. Configurazione della workstation LLM
#6. DeepSeek V3 671B su M3 Ultra 512 GB
È il caso d'uso di punta del Mac Studio da 512 GB. Il modello occupa 380 GB in Q4_K_M e rientra nella RAM della configurazione da 512 GB, con un contesto di 16k a ~16 tok/s (MoE, ~37B di parametri attivi su 671B). Qualità vicina a quella dei migliori modelli proprietari nella maggior parte delle attività.
Sai quali modelli sono alla portata di un Mac Studio. Il kit Mac fornisce la tabella di riferimento per chip e per quantità di memoria (cap. 4), il calcolo del budget di memoria per contesti lunghi (cap. 5) e la messa in servizio di Ollama in background (cap. 7).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Download
- Circa 380 GB attraverso Hugging Face. Prevedi 4-8 ore a seconda della connessione.
- Tempo di caricamento
- ~60 secondi la prima volta (SSD → RAM). Istantaneo in seguito, finché il modello rimane in memoria.
- Consumo in inferenza
- ~150 W. Raggiunge i 70-75 °C. Ventilatore udibile ma non rumoroso (rumorosità molto inferiore a quella di un PC equivalente).
- Quando vale la pena
- Ricerca e sviluppo, team che vogliono un modello di frontiera al 100% offline, benchmark interno, dataset sensibili. Per la produzione, l'API cloud è più economica.
#Mac Studio vs PC con 2× RTX 5090
- Prezzo 2026
- Mac Studio M3 Ultra 512 GB: ~11 300 € a catalogo fino a settembre 2026, non è più venduto nuovo (M5 Ultra 512 GB annunciato a fine ottobre). PC 2× RTX 5090 + piattaforma: ≈ 15 000 €.
- Memoria utile per gli LLM
- Mac: 512 GB di memoria unificata. PC: 2 × 32 GB di VRAM = 64 GB. Per modelli da 400B in su (Maverick 402B, DeepSeek 671B), il PC semplicemente non può caricare il modello.
- Velocità su un ~30B (Qwen 3.6 35B-A3B)
- PC con due 5090: ~120 tok/s (CUDA, il modello rientra nella VRAM). Mac M3 Ultra: ~70 tok/s. Vantaggio del PC per i modelli che rientrano nella VRAM.
- Velocità su DeepSeek 671B / Maverick 402B
- Mac: 16-34 tok/s (MoE). PC: impossibile senza offload CPU massivo (< 2 tok/s).
- Consumo
- Mac Studio: picco di 150 W. PC 2× 5090: massimo 900 W. Prevedere una bolletta elettrica 3× più alta per il PC.
- Rumore
- Mac: rumore leggero ma udibile. PC con 2× 5090: molto rumoroso (ventole delle GPU al massimo).
- Verdetto
- Il Mac Studio prevale per capacità (modelli 200B+) ed efficienza. Il PC prevale per velocità pura sui modelli che entrano in VRAM (≤ ~30 GB). Scegli in base al tipo di modelli che intendi usare.
#Domande frequenti
Quale Mac Studio per gpt-oss 120B?+
Il Mac Studio M3 Ultra da 512 GB vale 11 000 €?+
Mac Studio M3 Ultra 256 GB o 512 GB?+
È possibile installare un Mac Studio in un rack per server?+
Il Mac Studio M4 Max è meglio di un MBP M4 Max?+
Qual è la durata di vita prevista di un Mac Studio utilizzato per l'inferenza 24/7?+
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.