MLX: LLM ottimizzati per Apple Silicon (M1-M4)

Eseguire un MLX Apple Silicon LLM su un Mac recente significa sfruttare la memoria unificata dei chip da M1 a M4 per eseguire modelli open-weights da 7 a 235 miliardi di parametri in locale. Il framework MLX, pubblicato da Apple Research alla fine del 2023, sfrutta direttamente il Neural Engine e la GPU integrata tramite Metal, senza passare per CUDA. Questa guida illustra il funzionamento di MLX, i modelli compatibili, i quantitativi realistici di VRAM per ciascuna quantizzazione, le velocità osservate su M3 Max e M4 Pro, i benchmark di riferimento e i casi d'uso più solidi per un deployment self-hosted su macOS.

Perché MLX cambia le carte in tavola su Mac

MLX è una libreria di calcolo su array ispirata a NumPy e PyTorch, progettata specificamente per la memoria unificata di Apple Silicon. A differenza di llama.cpp che usa Metal come backend opzionale, MLX tratta la memoria della CPU e della GPU come un unico spazio: non è necessaria alcuna copia tra le due. Il repository ufficiale ml-explore/mlx su GitHub pubblica il codice sorgente sotto licenza MIT e il progetto associato mlx-examples fornisce implementazioni pronte all'uso per Llama, Mistral, Phi e Qwen.

Punti chiave da ricordare:

Per confrontare gli approcci Mac e Linux, vedi llama.cpp e GGUF insieme al nostro confronto MLX vs llama.cpp.

VRAM richiesta e quantizzazioni supportate

MLX offre diversi livelli di quantizzazione. Ecco gli ordini di grandezza, partendo dai valori FP16 e applicando i rapporti usuali (Q8 ≈ 50 %, Q4 ≈ 25 %, Q3 ≈ 20 %).

Modelli che girano senza difficoltà su un MacBook Pro M3 Max 128 GB o M4 Max 128 GB:

Modelli più grandi riservati al Mac Studio M3 Ultra con 192 GB o 512 GB:

Su larghissima scala, DeepSeek V3 671B (VRAM Q4 ~400 GB, ctx 128k) resta fuori portata anche per un Mac Studio da 512 GB in Q4, ma si può prendere in considerazione in Q2/Q3 con un po' di offload su disco. Scheda completa su DeepSeek V3 671B.

Performance misurate: token al secondo

I numeri qui sotto provengono dalla documentazione ufficiale mlx-lm e di osservazioni riproducibili della comunità su Hugging Face. Tutte le velocità sono stime e dipendono dal prompt, dal contesto e dal livello di quantizzazione.

I modelli MoE come Qwen3-Coder-Next 80B-A3B (VRAM Q4 ~48 GB) beneficiano particolarmente della memoria unificata: solo 3B di parametri attivi attraversano le unità di calcolo per ogni token, il che spinge la velocità oltre i 25 token/sec sul M4 Max secondo i feedback degli utenti (da confermare). Vedi Qwen3-Coder-Next 80B-A3B.

Licenze e compatibilità con MLX

MLX non impone alcuna restrizione oltre a quelle previste dalla licenza del modello originale. Alcuni casi tipici:

Per un uso in produzione, preferisci Apache 2.0 o MIT. Consultare la nostra guida sulle licenze LLM open-weights per i dettagli delle clausole.

Benchmark di riferimento su modelli compatibili con MLX

I punteggi riportati qui provengono dalle schede tecniche ufficiali pubblicate su Hugging Face e dalle schede dei modelli pubblicate dai produttori.

Per esplorare in dettaglio i modelli più performanti nella programmazione, vedere Migliore LLM per il codice e per il ragionamento miglior LLM per il ragionamento.

Installazione e flusso di lavoro concreto

L'installazione si riduce a tre comandi dopo aver preparato un ambiente Python 3.10+:

pip install mlx mlx-lm
python -m mlx_lm.convert --hf-path meta-llama/Llama-3.3-70B-Instruct -q
python -m mlx_lm.generate --model ./mlx_model --prompt "Bonjour"

La conversione -q applica di default una quantizzazione 4-bit. I checkpoint convertiti vengono pubblicati direttamente su Hugging Face mlx-community, evitando così la fase di conversione locale per i modelli popolari.

I casi d'uso in cui MLX si distingue particolarmente:

Per confrontare MacBook Pro e Mac Studio in base al modello che vuoi usare, consulta LLM per MacBook Pro.

FAQ

Q: Qual Mac scegliere per eseguire Llama 3.3 70B localmente?

Un MacBook Pro M3 Max o M4 Max con 64 GB permette di eseguire Llama 3.3 70B Instruct con quantizzazione a 4 bit (VRAM ~40 GB). Con 48 GB si è al limite, ma è possibile in Q3. Per contesti lunghi o batch, punta a 128 GB. Il Mac Studio M3 Ultra da 192 GB resta la scelta più comoda per questo modello.

Q: MLX è più veloce di llama.cpp su Mac?

MLX ottiene generalmente un miglioramento dal 10 al 30% nella generazione di testi lunghi grazie alla memoria unificata nativa e al compilatore di grafi. llama.cpp rimane competitivo sul prefill e offre un ecosistema più ampio (server integrato compatibile con OpenAI, quantizzazioni GGUF più varie). I due possono coesistere: MLX per lo sviluppo, llama.cpp per il deploy headless.

Q: È possibile fare fine-tuning LoRA con MLX?

Sì. Il sottoprogetto mlx-examples/lora permette di addestrare adattatori LoRA e QLoRA su Llama, Mistral e Qwen. Su un M3 Max con 64 GB, un fine-tuning LoRA di Mistral Small 4 a 4 bit resta fuori portata, ma i modelli da 7B a 13B si addestrano in poche ore.

Q: MLX gestisce i modelli MoE come Mixtral o Qwen 3 235B?

Sì. Mixtral 8x22B Instruct et Qwen 3 235B-A22B sono supportati tramite mlx-lm. L'architettura MoE è particolarmente adatta alla memoria unificata: gli esperti inattivi risiedono in RAM senza penalizzare la latenza. Su Mac Studio M3 Ultra 192 GB, Qwen 3 235B-A22B in 4-bit rimane utilizzabile con un contesto ragionevole.

Q: Quali modelli non sono utilizzabili su Apple Silicon?

I modelli >500B a piena precisione restano fuori portata persino per il Mac Studio da 512 GB: DeepSeek V4 Pro 1.6T (VRAM Q4 ~960 GB), MiMo V2.5 Pro (VRAM Q4 ~595 GB), Kimi K2.6 (VRAM Q4 ~600 GB). Con quantizzazioni aggressive Q2 o Q3 e offload su disco, alcuni diventano testabili in via sperimentale, ma la velocità cala drasticamente.

Q: MLX supporta i modelli vision-language?

Sì, parzialmente. Qwen 2.5 VL 72B et LLaVA-OneVision 72B dispongono di porting MLX realizzati dalla comunità su Hugging Face. La copertura è più limitata rispetto agli LLM esclusivamente testuali, ma il progetto mlx-vlm mantenuto dalla comunità colma il divario sulle architetture multimodali più comuni.

Conclusione

Un MLX Apple Silicon LLM trasforma un Mac recente in una seria workstation per l'inferenza: Llama 3.3 70B, Qwen 2.5 72B o gpt-oss 120B funzionano a 4 bit su un MacBook Pro con 64-128 GB, e i modelli MoE come Qwen 3 235B-A22B diventano accessibili su Mac Studio con 192 GB. Per scegliere il modello adatto alla tua configurazione hardware esatta, usa il nostro configuratore o sfoglia il catalogo completo dei 249 modelli indicizzati.

Articolo pubblicato il da Mohamed Meguedmi · Fonte dati: /api/models.json · Licenza dei contenuti: CC BY 4.0.

Un errore o un aggiornamento da segnalare? Contribuire.