Intermedio 14 minDeepSeek

DeepSeek V4 Flash 284B: il 1° frontier che gira su Mac Studio

DeepSeek V4 Flash 284B è uscito il 24 aprile 2026 insieme a V4 Pro. È la variante "efficiente": 284 miliardi di parametri totali in MoE (13B attivi per token), licenza MIT, contesto di 1M token, stessa architettura CSA+HCA e le stesse 3 modalità di ragionamento del Pro. Soprattutto, è il primo modello di classe frontier che entra nella memoria di una sola workstation: 170 GB in Q4 — basta un Mac Studio M3 Ultra da 256 GB. Questa guida spiega come installarlo e quanto vale.

Di Mohamed Meguedmi·Agg. 2026-08-11·Testato su Windows, macOS e Linux

#DeepSeek V4 Flash in sintesi

Data di uscita
24 aprile 2026, in contemporanea con V4 Pro. Disponibile su HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
Architettura
MoE 284B totali, 13B attivi per token. 128 esperti per layer, routing top-8. Varianti Base + Instruct disponibili.
Innovazioni ereditate dal Pro
Meccanismo di attenzione CSA+HCA, mHC, ottimizzatore Muon, addestramento misto FP4+FP8.
Contesto
1 milione di token nativi (identico al Pro).
Modalità thinking
3 livelli Non / High / Max — selezionabili tramite il prompt.
Licenza
MIT, identica a quella del Pro. Nessuna restrizione all'uso commerciale né di carattere geografico.

#1. Perché è un evento

Prima del 24 aprile 2026, eseguire in locale un modello di frontiera significava usare un cluster GPU da almeno 80.000 € oppure accettare la qualità inferiore di un modello da 70B. DeepSeek V4 Flash cambia la situazione: i suoi 170 GB in Q4 rientrano nella memoria di configurazioni usate da 4.000-8.000 €.

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Mac Studio M3 Ultra 256 GB
7 299 € a catalogo fino a settembre 2026, ora disponibile di seconda mano (il M5 Ultra 256 GB lo sostituisce nell'offerta Apple). 170 GB per il modello + 30 GB per il contesto = entra in memoria con ampio margine. ~10-12 tok/s in Q4.
2× RTX 5090 32 GB (64 GB VRAM)
≈ 11.400 €. Insufficiente — mancano ~110 GB. Possibile con offload sulla CPU, ma lento (3-5 tok/s).
4× RTX A6000 48 GB (192 GB VRAM)
~12.000 € sul mercato dell'usato. Il modello ci sta comodamente, ~18–25 tok/s.
Workstation 2× Mac Studio Max 64 GB
Insufficiente in singolo. Con llama.cpp RPC swarm e 4× Mac Studio: possibile, circa 5 tok/s.
→
La vera particolarità: Mac Studio Ultra
Il M3 Ultra 256 GB (7 299 € a catalogo fino a settembre 2026, ora di seconda mano) esegue DeepSeek V4 Flash Q4 a circa 10 tok/s in modalità chat. Nessun altro computer personale al mondo, a questo prezzo, esegue un modello frontier. È Apple Silicon a renderlo possibile (memoria unificata + larghezza di banda di 800 GB/s).

#2. Architettura (variante efficiente di V4)

V4 Flash è una riduzione proporzionale del V4 Pro: circa 5,7 volte meno esperti, circa 3,8 volte meno parametri attivi, ma lo stesso scheletro CSA+HCA + Muon + FP4/FP8. Questa omogeneità permette a V4 Flash di ereditare la qualità del Pro a costo molto inferiore.

Esperti per layer
128 (vs 256 per Pro). Routing top-8 identico.
Parametri attivi
13B (rispetto ai 49B di Pro). Velocità di inferenza circa 3,8× superiore a parità di numero totale di parametri.
Strati
61 (Pro: 76). Riduzione moderata per preservare la profondità del ragionamento.
Head di attenzione
Identico al Pro (CSA+HCA configurati allo stesso modo). Nessun risparmio sull'attenzione, per preservare la qualità con contesti lunghi.
Pre-training
Obiettivo « efficient reasoning »: 18T token (vs 32T per Pro), con un mix di dati ottimizzato per matematica + codice.

#3. Hardware in base alla quantizzazione

VRAM totale richiesta (modello + cache KV da 32k token)
QuantizationVRAM del modello+ KV 32kConfigurazioni raccomandate
FP16 (di riferimento)568 GB~620 GBDC: 4× H200 141GB. Uso in locale impraticabile.
Q8_0305 GB~340 GBMac Studio M3 Ultra 512 GB o 8× RTX 4090 24GB.
Q5_K_M205 GB~235 GBMac Studio Ultra 256 GB (al limite), 4× RTX A6000 48 GB con un buon margine.
Q4_K_M170 GB~200 GBMac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB.
IQ3_M (compresso)130 GB~160 GBMac Studio M2 Ultra 192 GB, 4× RTX 4090 (offload leggero).
IQ2_XS (estremo)85 GB~115 GBRTX 5090 + 64 GB di RAM DDR5 per l'offload, oppure 2× RTX 4090.
i
Punto di equilibrio 2026
Mac Studio M3 Ultra 256 GB con Q4_K_M offre il miglior rapporto prezzo/qualità/velocità per un uso personale serio. 7.300 € nuovo fino a settembre 2026 (ora disponibile usato, oppure M5 Ultra 256 GB nuovo), ~10 tok/s, qualità quasi FP16 (Q4 perde <2 % sui benchmark a queste dimensioni). Nessun equivalente sul versante PC senza superare i 12.000 €.

#4. Configurazione del Mac Studio Ultra da 256/512 GB

Installazione completa su Mac Studio M3 Ultra
# 1. Relever la mémoire GPU allouable
sudo sysctl iogpu.wired_limit_mb=240640    # 256 Go : 235 Go GPU
# Ou pour Mac Studio 512 Go :
# sudo sysctl iogpu.wired_limit_mb=491520

# Persistant
echo "iogpu.wired_limit_mb=240640" | sudo tee -a /etc/sysctl.conf

# 2. llama.cpp avec Metal + Flash Attention
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# 3. Téléchargement Q4_K_M (~170 Go split en chunks)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF \
  --include "*Q4_K_M*.gguf" \
  --local-dir ./models

# 4. Lancement avec optimisations max
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 65536 \
  --host 0.0.0.0 --port 8080
→
Una volta avviato
Il server espone un'API compatibile con OpenAI all'indirizzo http://localhost:8080. Collegaci Open WebUI, Continue.dev, Aider, Raycast AI — tutti funzioneranno con il tuo modello di frontiera locale.

#5. Setup multi-GPU NVIDIA

#Opzione A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)

vLLM tensor-parallel
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 4 \
  --quantization fp8 \
  --max-model-len 1000000 \
  --enable-prefix-caching \
  --port 8000

#Opzione B — llama.cpp con offload parziale

2× RTX 5090 + offload CPU
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 50 \
  --tensor-split 0.5,0.5 \
  -ctk q8_0 -ctv q8_0 \
  -c 32768
!
Offload = lento
Tutto ciò che non entra nella VRAM passa nella RAM di sistema (DDR5 a circa 80 GB/s contro HBM3 a 1 TB/s). Con il 50% trasferito nella RAM di sistema, la velocità scende a 3-5 token/s. Per un uso interattivo, punta a mantenere il 100% nella VRAM.

#6. Benchmark e token/sec misurati

Benchmark pubblicati da DeepSeek (24 aprile 2026), valori in modalità High
BenchmarkV4 FlashV4 ProLlama 4 Scout 109BMistral Large 2
MMLU-Pro79.484.276.875.3
GPQA Diamond70.178.563.259.4
AIME 202576.587.061.352.1
LiveCodeBench v572.679.865.461.8
LongBench v2 (1M)68.972.6——
Tokens al secondo misurati (chat, contesto 4k, Q4_K_M)
SetupTok/s in modalità NonTok/s modalità HighTok/s in modalità Max
Mac Studio M3 Ultra 256 GB10-128-105-7
Mac Studio M3 Ultra 512 GB12-1410-127-9
4× RTX A6000 48GB20-2516-2012-15
2× RTX 5090 + 64GB offload3-52-41-2

#7. Modalità thinking e contesto lungo

V4 Flash eredita i tre modi di ragionamento di V4 Pro con qualità leggermente inferiore, ma con un costo di inferenza molto più basso. È la scelta giusta per agenti che devono ragionare senza monopolizzare un'infrastruttura.

Modalità Non
Risposta diretta. Latenza molto bassa (~1s per avviare lo streaming). Per chat conversazionale, traduzione.
Modalità High
200-2000 token di chain-of-thought prima della risposta. +25% di qualità in matematica e programmazione. Latenza di 5-15 secondi prima del primo token della risposta finale.
Modalità Max
Fino a 16k token di riflessione. Latenza di 1–5 minuti in locale. Da riservare ai problemi difficili (dimostrazioni matematiche, debug complesso).
Contesto lungo 1M
Stesse capacità di V4 Pro grazie all'HCA — Needle-in-Haystack 1M ~95 % (contro il 98 % di Pro). Eccellente per il RAG su grandi raccolte di dati.

#V4 Flash vs V4 Pro: scegliere

Confronto sintetico
CriterioV4 Flash 284BV4 Pro 1.6T
Parametri totali284 B1 600 B
Parametri attivi / token13 B49 B
VRAM Q4_K_M170 GB960 GB
Hardware minimo per l'esecuzione in localeMac Studio Ultra 256 GB (M3 Ultra di seconda mano o M5 Ultra nuovo)Cluster ~80 000 €
Velocità tipica in locale (token/s)10-250,5-2
Qualità MMLU-Pro79.484.2
Qualità AIME 202576.587.0
Contesto nativo1 M1 M
Modalità thinking maxSìSì (qualità migliore)
LicenzaMITMIT
→
Quando scegliere Flash, quando scegliere Pro
V4 Flash: 95 % dei casi — chat, codice, RAG, agenti, contesto lungo. L'unico modello di frontiera che entra in una workstation. V4 Pro: ricerca pura (matematica, dimostrazioni, AIME competitivo), workflow in cui la qualità massima conta più della latenza e del costo hardware.

#Reso ufficiale il 31 luglio 2026 (build 0731)

DeepSeek ha fatto uscire V4-Flash dalla fase di preview a fine luglio 2026 con la build «0731»: API in beta pubblica e, nello stesso tempo, il prezzo dei token di output di V4-Pro scende del 75% (0,87 $ per milione di token di output). Artificial Analysis colloca nuovamente la famiglia V4 «tra i leader open weights». Quanto ai pesi, nulla cambia: 284B in totale e 13B attivi — ancora l'unica variante V4 parzialmente utilizzabile in locale su hardware di fascia alta (Mac 256 GB, Strix Halo, multi-GPU) con una quantizzazione aggressiva.

Dal 2 agosto, anche LM Studio lo propone: in locale se la tua macchina ha risorse sufficienti, oppure tramite l'app Bionic su server statunitensi con «Zero Data Retention» per impostazione predefinita — un compromesso da conoscere, anche se la filosofia di questo sito rimane quella del 100% locale.

#FAQ

DeepSeek V4 Flash funziona davvero su Mac Studio M3 Ultra 256 GB?+
Sì, in Q4_K_M: 170 GB per il modello + 30 GB per il contesto 32k + 8 GB per il sistema = ~210 GB, entro i 256 GB. Velocità misurata: 10-12 tok/s in modalità Non, 8-10 in High. È l'unico Mac in grado di farlo su una singola macchina ad aprile 2026.
Quanto costa una configurazione adeguata per eseguire V4 Flash in locale?+
Tre budget: (1) Mac Studio Ultra 256 GB — M3 Ultra di seconda mano (7 300 € nuovo fino a settembre 2026) o M5 Ultra nuovo. (2) ~12 000 € — 4× RTX A6000 48GB di seconda mano + workstation. (3) ≈ 11 400 € — 2× RTX 5090 + 64 GB DDR5 + offload, ma lento (3-5 tok/s).
Conviene scegliere V4 Flash o aspettare una distillazione 70B?+
DeepSeek ha annunciato distillazioni 70B e 32B entro 4-6 settimane. Se non hai un Mac Studio Ultra o un cluster GPU, aspettare ha senso. Se ne hai già uno, V4 Flash ora >> distillazione 70B in 5 settimane (qualità superiore e contesto 1M).
V4 Flash supera Llama 4 Maverick / Scout?+
Sui benchmark pubblicati da DeepSeek: sì, su tutti (MMLU-Pro 79.4 vs 76.8 per Scout, GPQA 70.1 vs 63.2). Conferma indipendente attesa entro 2 settimane tramite Chatbot Arena. Vantaggio chiaro di V4 Flash: contesto nativo 1M, mentre Llama 4 resta a 256k.
Qual è il consumo elettrico di un Mac Studio M3 Ultra in inferenza V4 Flash?+
Picco ~150 W durante la generazione, ~30 W a riposo dopo il caricamento. In 8 ore di utilizzo attivo: ~1,2 kWh = ~0,30 €/giorno (FR 2026). Una lampadina LED consuma di più in standby.
Vale la pena usare la modalità thinking Max su V4 Flash?+
Su Mac Studio: sì per problemi complessi (matematica, dimostrazioni, debug), ma prevedi 1-5 minuti per risposta. Per il normale uso in chat, la modalità High è più che sufficiente (8-10 tok/s, qualità ~Mistral Large × 2).
È possibile fare il fine-tuning di V4 Flash in locale?+
LoRA / QLoRA: sì, su Mac Studio Ultra 512 GB con MLX-LM (supporto da verificare in base alla versione installata) o unsloth (NVIDIA, 4× A6000 minimo). Fine-tuning completo: non fattibile localmente — costo di training stimato tra 200 e 400 mila dollari in cloud.
Esiste una versione quantizzata Q4 stabile al 25 aprile 2026?+
Le versioni quantizzate ufficiali GGUF Q4_K_M e Q5_K_M usciranno questo weekend (26-27 aprile) su HuggingFace. Le versioni quantizzate AWQ per vLLM sono già disponibili (deepseek-ai/DeepSeek-V4-Flash-AWQ). Segui @DeepSeek_AI su X per gli annunci.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.