Avanzato 13 minMac Studio

Quale LLM su Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB) ?

Il Mac Studio (M2 Ultra, M3 Ultra, M4 Max) nel 2026 è l'unico computer al mondo destinato al grande pubblico capace di eseguire localmente modelli con più di 200 miliardi di parametri. L'M3 Ultra da 512 GB (uscito all'inizio del 2025, sostituito alla fine di settembre 2026 dall'M5 Ultra) ha portato la memoria unificata a 512 GB per circa 11.000 € — abbastanza per Llama 4 Maverick 402B in Q4 o DeepSeek V3 671B in Q4. Questa guida descrive in dettaglio ogni configurazione e i relativi casi d'uso.

Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda Mac Studio M5 Max →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su macOS 14+
Hardware consigliato

Alternativa d'acquisto per questa guida: Mac Studio M5 Max (36 GB / 512 GB).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su Mac Studio M5 Max (36 GB / 512 GB) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Mac Studio nel 2026

Mac Studio M2 Ultra (2023)
24 core CPU + 60 o 76 core GPU, 800 GB/s, RAM 64/128/192 GB. Tuttora disponibile di seconda mano a partire da 2800 €.
Mac Studio M4 Max (2025)
16 core CPU + 40 core GPU, 546 GB/s, RAM 36-128 GB. Sostituisce il M2 Max. Non è più venduto nuovo da Apple: sostituito a fine settembre 2026 dal M5 Max (a partire da 2.999 €).
Mac Studio M3 Ultra (2025)
28 core CPU + 60 o 80 core GPU, 800 GB/s, RAM 96/256/512 GB. Il mostro. Venduto da 4499 € (96 GB) a 11 299 € (512 GB) fino all'arrivo del M5 Ultra; non più nel catalogo Apple a fine settembre 2026 (usato o scorte residue).
Consumo
15 W a riposo, 70-130 W durante l'inferenza a seconda della configurazione. Il M3 Ultra con 512 GB raggiunge un picco di circa 150 W con un modello da 405B.
→
La scheda memoria è il vero prodotto
Il Mac Studio M3 Ultra non è solo un computer veloce: è l'unica macchina «consumer» a offrire 512 GB di RAM accessibili alla GPU. Nessun PC, nemmeno da 20.000 €, offre questa possibilità nativamente. Per chi vuole far girare modelli da 400B+ in locale, non c'è alternativa.

#1. M2 Ultra vs M3 Ultra vs M4 Max

M4 Max
Versione di base del Mac Studio. 546 GB/s, massimo 128 GB. Meglio di un MBP M4 Max: nessun throttling, prezzo inferiore (formato desktop).
M2 Ultra
Prima generazione Ultra. 800 GB/s, fino a 192 GB. Usato tra 2800 e 4500 €. Ancora competitivo per i modelli da 70B a 123B.
M3 Ultra
L'Ultra più recente (2025). 800 GB/s, come l'M2 Ultra, ma con architettura M3 (+20% in pratica). Da 96 a 512 GB di RAM. Per chi vuole superare i 200B.
!
Perché non c'è l'M4 Ultra nel 2026?
Apple non ha lanciato un M4 Ultra. La gamma M4 si ferma al Max. Per un Ultra, bisognava scegliere il M3 Ultra (marzo 2025), prima dell'arrivo del M5 Ultra, nel catalogo Apple a partire da 6.599 € a fine settembre 2026.

#2. Fin dove spingersi con la RAM?

96 GB (M3 Ultra base)
4499 € a listino per il M3 Ultra, non più venduto nuovo (M5 Ultra 96 GB: 6 599 €). Fa girare gpt-oss 120B (MXFP4, 63 GB) a ~50 tok/s e i MoE ~30B (Qwen 3.6 35B-A3B) a ~70 tok/s, con margine per un contesto lungo. Punto ottimale per i grandi MoE fino a ~120B.
256 GB (M3 Ultra + 256)
7299 € nel listino del M3 Ultra, non più venduto nuovo. Permette di caricare Llama 4 Maverick 402B Q4 (230 GB) a ~34 tok/s e DeepSeek V3 671B Q2 (~240 GB). Per chi vuole modelli da 400B in su.
512 GB (M3 Ultra max)
11 299 € nel listino del M3 Ultra, non più venduto nuovo (M5 Ultra 512 GB: fine ottobre 2026). DeepSeek V3 671B Q4 (380 GB) ci sta, Qwen3-235B-A22B in Q8, contesto 128k+ sui grandi MoE. Ambito ricerca/R&D.
192 GB (M2 Ultra max)
Carica Qwen3-235B-A22B Q4 (133 GB) e Maverick 402B in Q3. Equivalente funzionale all'M3 Ultra da 256 GB, a un prezzo un po' più basso sul mercato dell'usato. Buon compromesso.

#3. Modelli esclusivi per Ultra

Modelli che solo un Mac Studio Ultra può caricare comodamente
ModelloQuantRAM richiestaM2 Ultra 192M3 Ultra 256M3 Ultra 512
gpt-oss 120BMXFP463 GB✓ 42 t/s✓ 50 t/s✓ 50 t/s
Qwen3-235B-A22BQ4_K_M133 GB✓ 26 t/s✓ 30 t/s✓ 30 t/s
Llama 4 Maverick 402BQ4_K_M230 GB—✓ 34 t/s✓ 34 t/s
Llama 4 Maverick 402BQ8_0410 GB——✓ 22 t/s
DeepSeek V3 671BQ2_K240 GB—✓ 20 t/s✓ 20 t/s
DeepSeek V3 671BQ4_K_M380 GB——✓ 16 t/s

#4. Benchmark 120B, 235B, 671B

Ordini di grandezza, Mac Studio M3 Ultra con GPU a 80 core e 512 GB (llama.cpp Metal, contesto 16k)
ModelloQ4_K_MQ5_K_MQ6_KFlash Attn 16k
gpt-oss 120B50 t/s——48 t/s
Qwen3-235B-A22B30 t/s28 t/s26 t/s27 t/s
Llama 4 Maverick 402B34 t/s30 t/s28 t/s31 t/s
DeepSeek V3 671B16 t/s14 t/s—15 t/s

#5. Configurazione della workstation LLM

Setup Mac Studio M3 Ultra 512 GB
# Ollama + optimisations max
brew install --cask ollama

launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
launchctl setenv OLLAMA_NUM_PARALLEL 4
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Relever mémoire GPU à 480 Go (sur 512 Go)
sudo sysctl iogpu.wired_limit_mb=491520
echo "iogpu.wired_limit_mb=491520" | sudo tee -a /etc/sysctl.conf

brew services start ollama

# Pour DeepSeek V3 671B : passer par llama.cpp maison
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# Lancement
./build/bin/llama-server \
  -m ./models/DeepSeek-V3-671B-Q4_K_M.gguf \
  -ngl 99 -fa -c 16384 \
  -ctk q8_0 -ctv q8_0 \
  --host 0.0.0.0 --port 8080

#6. DeepSeek V3 671B su M3 Ultra 512 GB

È il caso d'uso di punta del Mac Studio da 512 GB. Il modello occupa 380 GB in Q4_K_M e rientra nella RAM della configurazione da 512 GB, con un contesto di 16k a ~16 tok/s (MoE, ~37B di parametri attivi su 671B). Qualità vicina a quella dei migliori modelli proprietari nella maggior parte delle attività.

Il kit Mac

Sai quali modelli sono alla portata di un Mac Studio. Il kit Mac fornisce la tabella di riferimento per chip e per quantità di memoria (cap. 4), il calcolo del budget di memoria per contesti lunghi (cap. 5) e la messa in servizio di Ollama in background (cap. 7).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Download
Circa 380 GB attraverso Hugging Face. Prevedi 4-8 ore a seconda della connessione.
Tempo di caricamento
~60 secondi la prima volta (SSD → RAM). Istantaneo in seguito, finché il modello rimane in memoria.
Consumo in inferenza
~150 W. Raggiunge i 70-75 °C. Ventilatore udibile ma non rumoroso (rumorosità molto inferiore a quella di un PC equivalente).
Quando vale la pena
Ricerca e sviluppo, team che vogliono un modello di frontiera al 100% offline, benchmark interno, dataset sensibili. Per la produzione, l'API cloud è più economica.

#Mac Studio vs PC con 2× RTX 5090

Prezzo 2026
Mac Studio M3 Ultra 512 GB: ~11 300 € a catalogo fino a settembre 2026, non è più venduto nuovo (M5 Ultra 512 GB annunciato a fine ottobre). PC 2× RTX 5090 + piattaforma: ≈ 15 000 €.
Memoria utile per gli LLM
Mac: 512 GB di memoria unificata. PC: 2 × 32 GB di VRAM = 64 GB. Per modelli da 400B in su (Maverick 402B, DeepSeek 671B), il PC semplicemente non può caricare il modello.
Velocità su un ~30B (Qwen 3.6 35B-A3B)
PC con due 5090: ~120 tok/s (CUDA, il modello rientra nella VRAM). Mac M3 Ultra: ~70 tok/s. Vantaggio del PC per i modelli che rientrano nella VRAM.
Velocità su DeepSeek 671B / Maverick 402B
Mac: 16-34 tok/s (MoE). PC: impossibile senza offload CPU massivo (< 2 tok/s).
Consumo
Mac Studio: picco di 150 W. PC 2× 5090: massimo 900 W. Prevedere una bolletta elettrica 3× più alta per il PC.
Rumore
Mac: rumore leggero ma udibile. PC con 2× 5090: molto rumoroso (ventole delle GPU al massimo).
Verdetto
Il Mac Studio prevale per capacità (modelli 200B+) ed efficienza. Il PC prevale per velocità pura sui modelli che entrano in VRAM (≤ ~30 GB). Scegli in base al tipo di modelli che intendi usare.

#Domande frequenti

Quale Mac Studio per gpt-oss 120B?+
Il modello pesa 63 GB in MXFP4: serve almeno un Mac Studio da 96 GB: un M3 Ultra da 96 GB usato oppure, acquistandolo nuovo, un M5 Max da 96 GB o un M5 Ultra da 96 GB (6 599 €) — un M2 Ultra da 64 GB non lascia abbastanza margine per il contesto. Puoi aspettarti circa 50 tok/s sull'M3 Ultra, con spazio per un contesto lungo da 128k.
Il Mac Studio M3 Ultra da 512 GB vale 11 000 €?+
Per un ricercatore, un team R&D, un'azienda che tratta dati sensibili da non inviare nel cloud: assolutamente. Nessun concorrente esegue localmente Llama 4 Maverick 402B o DeepSeek 671B a questo prezzo. Per un privato, è probabilmente sovradimensionato: un Mac Studio con 128 GB (M4 Max usato o M5 Max nuovo) basta per il 95% degli usi.
Mac Studio M3 Ultra 256 GB o 512 GB?+
Ai prezzi di listino dell'M3 Ultra (non più venduto nuovo): 256 GB (7299 €) se il modello più grande che vuoi usare è Llama 4 Maverick 402B Q4 (230 GB) o DeepSeek V3 Q2. 512 GB (11299 €) se vuoi Maverick in Q8 o DeepSeek V3 Q4 (380 GB). La differenza di 4000 € si giustifica solo se ti spingi davvero oltre i 400B.
È possibile installare un Mac Studio in un rack per server?+
Sì, esistono soluzioni rack da 19" che ospitano da 2 a 4 Mac mini/Studio. Marche: Sonnet, MacStadium. Utili se ospiti un cluster LLM per un team.
Il Mac Studio M4 Max è meglio di un MBP M4 Max?+
Stesso chip, stesse prestazioni. Mac Studio vince sul prezzo (non ci sono schermo, tastiera o batteria da pagare) e sull'assenza totale di throttling — è possibile eseguire l'inferenza in modo continuativo 24/7. MBP vince sulla portabilità. Per un uso da postazione fissa, Studio senza esitazioni.
Qual è la durata di vita prevista di un Mac Studio utilizzato per l'inferenza 24/7?+
Apple non fornisce una cifra ufficiale, ma le testimonianze della comunità indicano 5-8 anni senza problemi hardware con inferenza continua. Il componente più a rischio è l'SSD (resistenza alle scritture), ma i modelli LLM vengono letti e raramente scritti: l'usura dell'SSD è minima.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.