DeepSeek V4 Flash 284B: il 1° frontier che gira su Mac Studio
DeepSeek V4 Flash 284B è uscito il 24 aprile 2026 insieme a V4 Pro. È la variante "efficiente": 284 miliardi di parametri totali in MoE (13B attivi per token), licenza MIT, contesto di 1M token, stessa architettura CSA+HCA e le stesse 3 modalità di ragionamento del Pro. Soprattutto, è il primo modello di classe frontier che entra nella memoria di una sola workstation: 170 GB in Q4 — basta un Mac Studio M3 Ultra da 256 GB. Questa guida spiega come installarlo e quanto vale.
#DeepSeek V4 Flash in sintesi
- Data di uscita
- 24 aprile 2026, in contemporanea con V4 Pro. Disponibile su HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
- Architettura
- MoE 284B totali, 13B attivi per token. 128 esperti per layer, routing top-8. Varianti Base + Instruct disponibili.
- Innovazioni ereditate dal Pro
- Meccanismo di attenzione CSA+HCA, mHC, ottimizzatore Muon, addestramento misto FP4+FP8.
- Contesto
- 1 milione di token nativi (identico al Pro).
- Modalità thinking
- 3 livelli Non / High / Max — selezionabili tramite il prompt.
- Licenza
- MIT, identica a quella del Pro. Nessuna restrizione all'uso commerciale né di carattere geografico.
#1. Perché è un evento
Prima del 24 aprile 2026, eseguire in locale un modello di frontiera significava usare un cluster GPU da almeno 80.000 € oppure accettare la qualità inferiore di un modello da 70B. DeepSeek V4 Flash cambia la situazione: i suoi 170 GB in Q4 rientrano nella memoria di configurazioni usate da 4.000-8.000 €.
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Mac Studio M3 Ultra 256 GB
- 7 299 € a catalogo fino a settembre 2026, ora disponibile di seconda mano (il M5 Ultra 256 GB lo sostituisce nell'offerta Apple). 170 GB per il modello + 30 GB per il contesto = entra in memoria con ampio margine. ~10-12 tok/s in Q4.
- 2× RTX 5090 32 GB (64 GB VRAM)
- ≈ 11.400 €. Insufficiente — mancano ~110 GB. Possibile con offload sulla CPU, ma lento (3-5 tok/s).
- 4× RTX A6000 48 GB (192 GB VRAM)
- ~12.000 € sul mercato dell'usato. Il modello ci sta comodamente, ~18–25 tok/s.
- Workstation 2× Mac Studio Max 64 GB
- Insufficiente in singolo. Con llama.cpp RPC swarm e 4× Mac Studio: possibile, circa 5 tok/s.
#2. Architettura (variante efficiente di V4)
V4 Flash è una riduzione proporzionale del V4 Pro: circa 5,7 volte meno esperti, circa 3,8 volte meno parametri attivi, ma lo stesso scheletro CSA+HCA + Muon + FP4/FP8. Questa omogeneità permette a V4 Flash di ereditare la qualità del Pro a costo molto inferiore.
- Esperti per layer
- 128 (vs 256 per Pro). Routing top-8 identico.
- Parametri attivi
- 13B (rispetto ai 49B di Pro). Velocità di inferenza circa 3,8× superiore a parità di numero totale di parametri.
- Strati
- 61 (Pro: 76). Riduzione moderata per preservare la profondità del ragionamento.
- Head di attenzione
- Identico al Pro (CSA+HCA configurati allo stesso modo). Nessun risparmio sull'attenzione, per preservare la qualità con contesti lunghi.
- Pre-training
- Obiettivo « efficient reasoning »: 18T token (vs 32T per Pro), con un mix di dati ottimizzato per matematica + codice.
#3. Hardware in base alla quantizzazione
| Quantization | VRAM del modello | + KV 32k | Configurazioni raccomandate |
|---|---|---|---|
| FP16 (di riferimento) | 568 GB | ~620 GB | DC: 4× H200 141GB. Uso in locale impraticabile. |
| Q8_0 | 305 GB | ~340 GB | Mac Studio M3 Ultra 512 GB o 8× RTX 4090 24GB. |
| Q5_K_M | 205 GB | ~235 GB | Mac Studio Ultra 256 GB (al limite), 4× RTX A6000 48 GB con un buon margine. |
| Q4_K_M | 170 GB | ~200 GB | Mac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB. |
| IQ3_M (compresso) | 130 GB | ~160 GB | Mac Studio M2 Ultra 192 GB, 4× RTX 4090 (offload leggero). |
| IQ2_XS (estremo) | 85 GB | ~115 GB | RTX 5090 + 64 GB di RAM DDR5 per l'offload, oppure 2× RTX 4090. |
#4. Configurazione del Mac Studio Ultra da 256/512 GB
#5. Setup multi-GPU NVIDIA
#Opzione A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)
#Opzione B — llama.cpp con offload parziale
#6. Benchmark e token/sec misurati
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Tok/s in modalità Non | Tok/s modalità High | Tok/s in modalità Max |
|---|---|---|---|
| Mac Studio M3 Ultra 256 GB | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512 GB | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2× RTX 5090 + 64GB offload | 3-5 | 2-4 | 1-2 |
#7. Modalità thinking e contesto lungo
V4 Flash eredita i tre modi di ragionamento di V4 Pro con qualità leggermente inferiore, ma con un costo di inferenza molto più basso. È la scelta giusta per agenti che devono ragionare senza monopolizzare un'infrastruttura.
- Modalità Non
- Risposta diretta. Latenza molto bassa (~1s per avviare lo streaming). Per chat conversazionale, traduzione.
- Modalità High
- 200-2000 token di chain-of-thought prima della risposta. +25% di qualità in matematica e programmazione. Latenza di 5-15 secondi prima del primo token della risposta finale.
- Modalità Max
- Fino a 16k token di riflessione. Latenza di 1–5 minuti in locale. Da riservare ai problemi difficili (dimostrazioni matematiche, debug complesso).
- Contesto lungo 1M
- Stesse capacità di V4 Pro grazie all'HCA — Needle-in-Haystack 1M ~95 % (contro il 98 % di Pro). Eccellente per il RAG su grandi raccolte di dati.
#V4 Flash vs V4 Pro: scegliere
| Criterio | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| Parametri totali | 284 B | 1 600 B |
| Parametri attivi / token | 13 B | 49 B |
| VRAM Q4_K_M | 170 GB | 960 GB |
| Hardware minimo per l'esecuzione in locale | Mac Studio Ultra 256 GB (M3 Ultra di seconda mano o M5 Ultra nuovo) | Cluster ~80 000 € |
| Velocità tipica in locale (token/s) | 10-25 | 0,5-2 |
| Qualità MMLU-Pro | 79.4 | 84.2 |
| Qualità AIME 2025 | 76.5 | 87.0 |
| Contesto nativo | 1 M | 1 M |
| Modalità thinking max | Sì | Sì (qualità migliore) |
| Licenza | MIT | MIT |
#Reso ufficiale il 31 luglio 2026 (build 0731)
DeepSeek ha fatto uscire V4-Flash dalla fase di preview a fine luglio 2026 con la build «0731»: API in beta pubblica e, nello stesso tempo, il prezzo dei token di output di V4-Pro scende del 75% (0,87 $ per milione di token di output). Artificial Analysis colloca nuovamente la famiglia V4 «tra i leader open weights». Quanto ai pesi, nulla cambia: 284B in totale e 13B attivi — ancora l'unica variante V4 parzialmente utilizzabile in locale su hardware di fascia alta (Mac 256 GB, Strix Halo, multi-GPU) con una quantizzazione aggressiva.
Dal 2 agosto, anche LM Studio lo propone: in locale se la tua macchina ha risorse sufficienti, oppure tramite l'app Bionic su server statunitensi con «Zero Data Retention» per impostazione predefinita — un compromesso da conoscere, anche se la filosofia di questo sito rimane quella del 100% locale.
#FAQ
DeepSeek V4 Flash funziona davvero su Mac Studio M3 Ultra 256 GB?+
Quanto costa una configurazione adeguata per eseguire V4 Flash in locale?+
Conviene scegliere V4 Flash o aspettare una distillazione 70B?+
V4 Flash supera Llama 4 Maverick / Scout?+
Qual è il consumo elettrico di un Mac Studio M3 Ultra in inferenza V4 Flash?+
Vale la pena usare la modalità thinking Max su V4 Flash?+
È possibile fare il fine-tuning di V4 Flash in locale?+
Esiste una versione quantizzata Q4 stabile al 25 aprile 2026?+
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.