DeepSeek V4 Pro in locale: VRAM, hardware, installazione
DeepSeek V4 Pro è il modello a pesi aperti più potente al mondo al suo lancio il 24 aprile 2026. 1,6 trilione di parametri in architettura MoE (49 miliardi attivi per token), licenza MIT, contesto 1M token, attenzione ibrida CSA+HCA e tre modalità di ragionamento. Su i benchmark pubblicati, si rivela competitivo con GPT-5 e Claude 4.7 — senza server cloud, senza API, senza limite di token. Questa guida spiega come sfruttarlo localmente e quali componenti servono.
#DeepSeek V4 Pro in breve
- Data di uscita
- 24 aprile 2026 — DeepSeek-AI su HuggingFace, pesi sotto licenza MIT, paper pubblicato contemporaneamente.
- Architettura
- Mixture-of-Experts denso: 1,6T parametri totali, 49B attivi per token, 256 esperti con routing top-8.
- Attenzione
- Attenzione ibrida CSA (Compressed Sparse Attention) + HCA (Hybrid Constrained Attention) — prima implementazione su questa scala.
- Contesto
- 1 milione di token nativi (con RoPE esteso e flash attention v3).
- Pre-training
- 32T+ token, ottimizzatore Muon (sostituisce AdamW), precisione mista FP4+FP8 (addestramento più efficiente noto)
- Modalità thinking
- 3 livelli: Non / High / Max. Il modo Max si avvicina alle prestazioni di o4 su AIME e GPQA.
- Licenza
- MIT — uso commerciale, redistribuzione e modifica autorizzati senza restrizioni. Più libera della licenza Llama.
#1. Architettura CSA+HCA e MoE 1.6T
DeepSeek V4 Pro combina tre innovazioni principali, ciascuna pubblicata separatamente negli ultimi 12 mesi e riunite qui per la prima volta su una scala di mille miliardi.
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- MoE 1,6T / 49B attivi
- 256 esperti per livello, routing top-8. Per ogni token, solo 49 miliardi di parametri partecipano al calcolo — da qui una velocità paragonabile a quella di un modello denso 50B nonostante le dimensioni totali.
- CSA — Compressed Sparse Attention
- Comprime le vecchie chiavi/valori del KV cache attraverso la decomposizione a bassa rango. Dividi per 4 la memoria di attenzione sui contesti >128k.
- HCA — Hybrid Constrained Attention
- Combina attenzione locale (finestra scorrevole 4k) e globale (sparsa) a seconda del layer. Throughput ×2 con un contesto lungo rispetto all'attenzione densa.
- mHC — multi-Head Compressor
- Meccanismo di compressione tra le teste — riduce la VRAM occupata dalle attivazioni senza perdita misurabile di qualità.
- Optimizzatore Muon
- Successore di AdamW, converge 1,8 volte più velocemente durante il preaddestramento di modelli molto grandi. Adottato da DeepSeek a partire da V3.5.
- Addestramento FP4+FP8
- Combinazione di FP4 sui layer di attenzione e FP8 sugli MLP. -45 % di memoria per l'addestramento rispetto a FP8 puro, qualità preservata grazie a uno schema di scaling proprietario.
#2. Le 3 modalità di ragionamento (Non / High / Max)
Il sistema di ragionamento di DeepSeek V4 Pro è esplicito e può essere attivato o disattivato, a differenza delle modalità opache dei modelli proprietari concorrenti.
- Modalità Non (predefinita)
- Risposta diretta senza una catena di ragionamento visibile. Latenza minima (~2–5 s a 8 tok/s). Per chat, traduzione e generazione di testo semplice.
- Modalità High
- Inserisce 200-2000 token di riflessione prima della risposta. +30-40 % di qualità in matematica, codice e analisi. Attivabile tramite il flag /think in Ollama o l'header thinking_mode nell'API.
- Modalità Max
- Ragionamento esaustivo (fino a 16k token di chain-of-thought). Si avvicina alle prestazioni di o4 su AIME 2025 (87% contro il 91% di o4). Costoso: 10-30 minuti per richiesta in locale.
#3. Hardware richiesto in base alla quantizzazione
| Quantization | VRAM del modello | + KV 32k | Configurazioni possibili |
|---|---|---|---|
| FP16 (di riferimento) | 3 200 GB | ~3 350 GB | DC: 16× H100 80GB o 8× H200 141GB. Non praticabile in locale. |
| Q8_0 | 1 700 GB | ~1 800 GB | Cluster di 8× H200 da 141 GB. ~250 mila dollari di hardware. |
| Q5_K_M | 1 150 GB | ~1 230 GB | Cluster di 3 Mac Studio da 512 GB, oppure 4× H200 da 141 GB. |
| Q4_K_M | 960 GB | ~1 040 GB | Cluster con 8× A100 80GB, oppure 2× Mac Studio da 512 GB collegati in uno swarm di rete. |
| IQ3_M (compresso) | 720 GB | ~800 GB | Un solo Mac Studio 512 + offload parziale su SSD. Lento ma possibile. |
| IQ2_XS (estremo) | 480 GB | ~560 GB | Solo Mac Studio da 512 GB, qualità fortemente degradata. |
#4. Installazione locale
Tre opzioni in base alla tua infrastruttura: llama.cpp per uno swarm su più macchine, vLLM per un cluster GPU omogeneo o MLX-distributed per uno swarm di Mac Studio.
#Opzione A — llama.cpp distribuito (consigliata per più macchine)
#Opzione B — vLLM su cluster H100/H200
#Opzione C — Ollama (quando il porting sarà disponibile)
Al 25 aprile 2026, Ollama non ha ancora integrato DeepSeek V4 Pro (le versioni quantizzate Q4_K_M della community escono questo fine settimana). Segui gli aggiornamenti su ollama.com/library.
#5. Benchmark rispetto a GPT-5, Claude 4.7, Gemini 3
| Benchmark | DeepSeek V4 Pro Max | GPT-5 | Claude 4.7 Opus | Gemini 3 Ultra |
|---|---|---|---|---|
| MMLU-Pro | 84.2 | 85.1 | 84.7 | 83.9 |
| GPQA Diamond | 78.5 | 76.8 | 79.2 | 77.1 |
| AIME 2025 | 87.0 | 82.4 | 85.6 | 80.2 |
| LiveCodeBench v5 | 79.8 | 78.2 | 75.4 | 76.1 |
| SWE-bench Verified | 59.4 | 62.1 | 63.8 | 55.7 |
| LongBench v2 (1M) | 72.6 | — | 68.4 | 70.2 |
| Humanity's Last Exam | 26.8 | 23.4 | 25.1 | 22.9 |
#6. Sfruttare il contesto di 1M token
Il contesto 1M è nativo (non esteso tramite YaRN), grazie a HCA. È uno dei tre o quattro modelli a pesi aperti al mondo a offrire 1M, e l'unico a farlo con questa qualità nel recupero delle informazioni.
- Needle-in-Haystack 1M
- Recupero del 98 % sull'intero contesto (contro il 76 % di Gemini 1.5 Pro a parità di condizioni).
- Caso d'uso 1 — Intere basi di codice
- net/* del kernel Linux (~800 k token) acquisito in un'unica volta, refactoring tra file con una sola richiesta.
- Caso d'uso 2 — Ricerca giuridica
- Codice civile + sentenze recenti (~600 k token) nel contesto, estrazione della giurisprudenza in una sola passata.
- Use case 3 — Analisi contabile
- 10 anni di bilanci + allegati (~400 k token), rilevazione di anomalie su più esercizi.
- VRAM per la cache KV a 1M
- Con KV Q4 e CSA attivo: ~280 GB. A 1M senza compressione: ~2 TB (impraticabile).
#7. Casi d'uso ideali
- Ricerca scientifica
- Matematica, fisica teorica, chimica computazionale. La modalità Max supera o4 su alcuni benchmark AIME/Putnam.
- Sicurezza / sovranità
- Banche, difesa, sanità, governo: modello di frontiera ospitato al 100 % su infrastruttura propria, con licenza MIT e sottoponibile ad audit. Nessun equivalente se non LLaMA 4 (licenza più restrittiva).
- Agenti complessi a lungo termine
- Il contesto 1M + ragionamento Max + 49B attivi lo rendono un agente migliore rispetto ai modelli densi più piccoli, senza il costo di inferenza di un GPT-5.
- RAG su scala enterprise
- Base di conoscenza composta da diversi milioni di token (codebase, documenti interni, norme ISO). Ricerca diretta senza retrieval grazie al contesto.
#Limiti e alternative
- Hardware dal costo proibitivo per i privati
- Min 960 GB VRAM Q4 = cluster ~80.000 € di seconda mano. Fuori portata di un privato.
- Tooling maturità insufficiente a J+1
- Quantizzazioni GGUF della comunità in preparazione, vLLM richiede il ramo dev, MLX-distributed è ancora sperimentale. Attendere circa 2 settimane per la stabilità.
- Impronta carbonica
- Cluster 8× H200 24/7 = ~45 MWh/anno. Da confrontare con l'uso delle API (che consentono un migliore ammortamento).
- Alternative più accessibili
- DeepSeek V4 Flash 284B (170 GB in Q4, entra nella memoria di un Mac Studio) · DeepSeek V3.2 671B (240 GB in Q2 su Mac Studio 512) · Llama 4 Behemoth (qualità simile).
#FAQ
DeepSeek V4 Pro è davvero meglio di GPT-5?+
Qual è la licenza esatta di DeepSeek V4 Pro?+
Perché 1,6T parametri se solo 49B sono attivi?+
È possibile eseguire DeepSeek V4 Pro su un solo Mac Studio Ultra da 512 GB?+
Qual è la differenza tra le 3 modalità thinking?+
Come attivare la modalità thinking in Ollama / vLLM / API?+
DeepSeek V4 Pro può elaborare immagini (multimodale)?+
I modelli distillati (70B, 32B, 14B) arrivano?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.