Mac Studio M5 Max / M5 Ultra: test e valutazione per l'IA locale
La prima macchina destinata al grande pubblico capace di eseguire un modello frontier in locale. Vediamo cosa conta per eseguire gli LLM in locale : memoria, banda passante, velocità, prezzo — e per chi è (o non è) l'acquisto giusto.
Aggiornato il 05/10/2026
Dove acquistarlo
La configurazione del pulsante è quella proposta all'acquisto. Su mini-PC, riserva della memoria per il sistema e verifica il motore di inferenza; macOS/MLX e CUDA non sono intercambiabili.
Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza queste raccomandazioni (stabilite in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
Scheda tecnica
- MemoriaM5 Max: da 36 a 128 GB · M5 Ultra: da 96 a 512 GB di memoria unificata (la configurazione da 512 GB arriva a fine ottobre)
- Larghezza di bandaM5 Max: 460 GB/s (GPU a 32 core) / 614 GB/s (GPU a 40 core) · M5 Ultra: fino a 1,2 TB/s (+50% rispetto alla generazione precedente)
- CalcoloM5 Max: CPU a 18 core, GPU fino a 40 core · M5 Ultra: CPU a 36 core, GPU a 80 core, Neural Engine a 32 core — Neural Accelerators in ogni core GPU, Thunderbolt 5, SSD PCIe Gen 6
- ConsumoComputer fisso, raffreddamento silenzioso
- Prezzo indicativo2 999 € (M5 Max 36 GB / 512 GB) · 6 599 € (M5 Ultra 96 GB / 1 TB) — fino a ≈ 20 000 € con 512 GB / 16 TB
- Modello più grande36 GB: classe 30B · 64-96 GB: 70B in Q4 · 128 GB: GPT-OSS-120B con ampio margine · 256 GB: Qwen3-235B (MoE) · 512 GB: MoE di frontiera ~600B in Q4, classe DeepSeek — vedi tabella dei livelli
Per chi?
Vantaggi e limiti
✓ Punti di forza
- 512 GB di memoria unificata a 1,2 TB/s: un modello da circa 600 miliardi di parametri (Q4) può essere caricato INTERAMENTE in locale — una novità al di fuori dei server
- Apple annuncia fino a 4,3× le prestazioni IA rispetto alla generazione precedente (Neural Accelerators per core GPU)
- macOS + MLX: l'ecosistema LLM locale più ottimizzato per Apple (LM Studio, Ollama, mlx-lm)
- Silenzioso, compatto, consumi ridotti rispetto alla capacità offerta — nessun PC tower multi-GPU può ospitare 512 GB di VRAM
- Thunderbolt 5 e SSD PCIe Gen 6: caricamento dei pesi molto più veloce
✗ Limiti
- La versione da 512 GB verrà spedita solo a fine ottobre 2026 (le altre a partire dal 22/09)
- Prezzo Apple: la configurazione da 512 GB supera largamente i 10.000 € — riservata agli usi professionali seri
- Sotto i 96 GB, un mini-PC Strix Halo 128 GB (≈ 3 300–4 000 €) offre più memoria per euro
- Senza CUDA: il fine-tuning pesante e alcuni strumenti rimangono più semplici da usare con NVIDIA
Quali tagli di memoria per quali modelli?
La regola: la memoria fissa la dimensione del modello caricabile, la banda passante fissa la velocità di generazione. Velocità indicate approssimativamente per la generazione di testo (decodifica), quantizzazione Q4, tramite MLX / llama.cpp — i modelli MoE utilizzano solo i loro parametri attivi, per cui offrono velocità elevate.
| Configurazione | Larghezza di banda | Ciò che gira (Q4) | Velocità stimata |
|---|---|---|---|
| M5 Max 36 GB | 460 GB/s | Classe 30B : Qwen3-32B, GLM-4.7-Flash | ~25-35 tok/s |
| M5 Max 64 GB | 614 GB/s (GPU 40 c.) | 70B in Q4 (~40 GB); MoE 30B-A3B molto veloci | ~13-16 tok/s (70B) · 80+ tok/s (MoE A3B) |
| M5 Max 128 GB | 614 GB/s | 70B in Q8, GPT-OSS-120B (MXFP4), contesto lungo | ~40-60 tok/s (GPT-OSS-120B) |
| M5 Ultra 96 GB | 1,2 TB/s | 70B in Q4 con margine di contesto | ~25-30 tok/s |
| M5 Ultra 256 GB | 1,2 TB/s | Qwen3-235B-A22B in Q4 (~135 GB) | ~25-35 tok/s |
| M5 Ultra 512 GB | 1,2 TB/s | MoE frontier ~600B in Q4 (classe DeepSeek, ~380-400 GB) | ~15-20 tok/s |
Il prefill (lettura del prompt) beneficia inoltre dei Neural Accelerators della GPU M5 — era il punto debole storico dei Mac rispetto alle GPU NVIDIA con contesti lunghi.
M5 Max o M5 Ultra ?
Le M5 Max (2 999 € con 36 GB, BTO fino a 128 GB) copre tutto fino ai modelli da 70B e ai MoE da ~120B: è la scelta razionale per esigenze elevate di sviluppo, assistenza come copilota e RAG. Scegli necessariamente il GPU a 40 core appena superi i 36 GB: la banda passante passa da 460 a 614 GB/s, cioè un terzo di velocità in più per ogni token.
Le M5 Ultra (6 599 € nella versione da 96 GB) si giustifica solo per la memoria: con 96 GB offre prestazioni appena migliori di un M5 Max da 128 GB più economico. La sua vera ragion d'essere sono i tagli di memoria 256 e 512 GB — gli unici a consentire l’esecuzione di MoE da 235 a ~600 miliardi di parametri. Se non hai un uso preciso per questi modelli, l’Ultra è un cattivo acquisto; se ce l’hai, è l’unico hardware desktop che permette di eseguirli.
Confronto con le alternative
| Macchina | Memoria | Larghezza di banda | Prezzo | L'uso giusto |
|---|---|---|---|---|
| Mac Studio M5 Max | 36-128 GB | 460-614 GB/s | a partire da 2.999 € | 70B e MoE ~120B veloci, ecosistema MLX |
| Mac Studio M5 Ultra | 96-512 GB | 1,2 TB/s | a partire da 6.599 € | MoE 235-600B: senza equivalente desktop |
| Mini-PC Strix Halo | 64-128 GB | 212 GB/s | ≈ 2 000-4 000 € | Il migliore rapporto memoria/euro (70B lento ma accessibile) |
| NVIDIA DGX Spark | 128 GB | 273 GB/s | ≈ 6 100 – 6 600 € | Ecosistema CUDA obbligatorio, fine-tuning |
| RTX 5090 | 32 GB | 1,79 TB/s | ≈ 5 700 € | La velocità pura fino a ~32B, non oltre |
In sintesi: velocità pura sui modelli piccoli → GPU dedicata; capacità massima per euro → Strix Halo; capacità massima in assoluto → M5 Ultra.
Disponibilità: cosa bisogna sapere
- In vendita dal 22 settembre 2026 (pre-ordini aperti il 25 agosto).
- La configurazione da 512 GB verrà spedito solo a fine ottobre — ordina per tempo se è la configurazione a cui punti.
- Presso i rivenditori francesi: M5 Max 36 GB / 512 GB da Darty e M5 Max 96 GB / 512 GB da Materiel.net; le altre capacità di memoria sono disponibili tramite il configuratore BTO dell'Apple Store.
- Il Mac Studio M4 Max 36 GB / 512 GB non è più disponibile nuovo presso i nostri rivenditori (verificato a fine settembre 2026) — la nostra scheda M4 Max per confrontare.
Verdetto
Domande frequenti
Il Mac Studio M5 Max / M5 Ultra può eseguire un LLM 70B in locale?
36 GB: classe 30B · 64-96 GB: 70B in Q4 · 128 GB: GPT-OSS-120B con ampio margine · 256 GB: Qwen3-235B (MoE) · 512 GB: MoE di frontiera da ~600B in Q4, classe DeepSeek — vedi tabella dei livelli.
Quanto costa il Mac Studio M5 Max / M5 Ultra?
Prevedere 2 999 € (M5 Max 36 GB / 512 GB) · 6 599 € (M5 Ultra 96 GB / 1 TB) — fino a ≈ 20 000 € nella configurazione da 512 GB / 16 TB (a partire da 2 499 $ (M5 Max) · 5 499 $ (M5 Ultra)). I prezzi cambiano rapidamente — verifica il prezzo del giorno tramite i link di acquisto.
A chi è destinato il Mac Studio M5 Max / M5 Ultra?
Sviluppatori e creatori su macOS che puntano a LLM di grandi dimensioni su una postazione fissa — dalla classe 30B (36 GB) fino ai MoE di frontiera da circa 600B in Q4 (512 GB).
È possibile eseguire localmente un modello di classe DeepSeek sul Mac Studio M5?
Sì, è LA novità: con 512 GB di memoria unificata, un modello MoE di frontiera da circa 600 miliardi di parametri quantizzato in Q4 (~380-400 GB di pesi) trova interamente posto in memoria, con una velocità di generazione stimata di 15-20 tok/s grazie all'architettura MoE (solo i parametri attivi vengono letti a ogni token). Vedi anche il nostro manuale DeepSeek V4 Flash.
È ancora possibile scegliere il Mac Studio M4 Max invece dell'M5?
Non più in vendita come prodotto nuovo presso i nostri rivenditori: il M4 Max 36 GB / 512 GB, venduto in saldo a 2 219 € durante l'estate per esaurire le scorte, non è più disponibile a fine settembre 2026. Il M5 Max prende il suo posto a 2 999 €: banda passante superiore, Neural Accelerators e tagli di memoria fino a 128 GB che il M4 Max non offre più.
Perché la memoria unificata supera una GPU per i grandi modelli?
Una GPU dedicata arriva al massimo a 32 GB di VRAM (RTX 5090): oltre questo limite, occorre trasferire parte del modello nella RAM di sistema tramite il bus PCIe e la velocità crolla. La memoria unificata Apple dà alla GPU accesso diretto a tutti i 96-512 GB: l'intero modello mantiene la piena larghezza di banda. È più lenta di una VRAM GDDR7 a parità di capacità, ma è l'unica soluzione desktop che «contiene» i modelli giganti.