Avanzato 16 minDeepSeek

DeepSeek V4 Pro in locale: VRAM, hardware, installazione

DeepSeek V4 Pro è il modello a pesi aperti più potente al mondo al suo lancio il 24 aprile 2026. 1,6 trilione di parametri in architettura MoE (49 miliardi attivi per token), licenza MIT, contesto 1M token, attenzione ibrida CSA+HCA e tre modalità di ragionamento. Su i benchmark pubblicati, si rivela competitivo con GPT-5 e Claude 4.7 — senza server cloud, senza API, senza limite di token. Questa guida spiega come sfruttarlo localmente e quali componenti servono.

Di Mohamed Meguedmi·Agg. 2026-04-25·Testato su Windows, macOS e Linux

#DeepSeek V4 Pro in breve

Data di uscita
24 aprile 2026 — DeepSeek-AI su HuggingFace, pesi sotto licenza MIT, paper pubblicato contemporaneamente.
Architettura
Mixture-of-Experts denso: 1,6T parametri totali, 49B attivi per token, 256 esperti con routing top-8.
Attenzione
Attenzione ibrida CSA (Compressed Sparse Attention) + HCA (Hybrid Constrained Attention) — prima implementazione su questa scala.
Contesto
1 milione di token nativi (con RoPE esteso e flash attention v3).
Pre-training
32T+ token, ottimizzatore Muon (sostituisce AdamW), precisione mista FP4+FP8 (addestramento più efficiente noto)
Modalità thinking
3 livelli: Non / High / Max. Il modo Max si avvicina alle prestazioni di o4 su AIME e GPQA.
Licenza
MIT — uso commerciale, redistribuzione e modifica autorizzati senza restrizioni. Più libera della licenza Llama.
→
Perché è un evento
DeepSeek V4 Pro è il primo modello a pesi aperti a superare GPT-4o su tutti i benchmark pubblici, con un costo di training annunciato di 12 milioni di dollari (vs circa 80 milioni per GPT-4). Licenza MIT — uno stato, una banca, un ospedale possono ospitarlo autonomamente senza accordo con un provider cloud. È un cambiamento di paradigma per la sovranità IA.

#1. Architettura CSA+HCA e MoE 1.6T

DeepSeek V4 Pro combina tre innovazioni principali, ciascuna pubblicata separatamente negli ultimi 12 mesi e riunite qui per la prima volta su una scala di mille miliardi.

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
MoE 1,6T / 49B attivi
256 esperti per livello, routing top-8. Per ogni token, solo 49 miliardi di parametri partecipano al calcolo — da qui una velocità paragonabile a quella di un modello denso 50B nonostante le dimensioni totali.
CSA — Compressed Sparse Attention
Comprime le vecchie chiavi/valori del KV cache attraverso la decomposizione a bassa rango. Dividi per 4 la memoria di attenzione sui contesti >128k.
HCA — Hybrid Constrained Attention
Combina attenzione locale (finestra scorrevole 4k) e globale (sparsa) a seconda del layer. Throughput ×2 con un contesto lungo rispetto all'attenzione densa.
mHC — multi-Head Compressor
Meccanismo di compressione tra le teste — riduce la VRAM occupata dalle attivazioni senza perdita misurabile di qualità.
Optimizzatore Muon
Successore di AdamW, converge 1,8 volte più velocemente durante il preaddestramento di modelli molto grandi. Adottato da DeepSeek a partire da V3.5.
Addestramento FP4+FP8
Combinazione di FP4 sui layer di attenzione e FP8 sugli MLP. -45 % di memoria per l'addestramento rispetto a FP8 puro, qualità preservata grazie a uno schema di scaling proprietario.
i
Cosa cambia in pratica
A parametri totali comparabili (1,6T), DeepSeek V4 Pro è circa 3 volte più veloce nell'inferenza rispetto a un modello denso equivalente e consuma 4 volte meno VRAM in contesti lunghi. Ciò rende possibile un'esecuzione locale Q4 su un cluster 8×H100 80 GB (invece di dover noleggiare un pod TPU).

#2. Le 3 modalità di ragionamento (Non / High / Max)

Il sistema di ragionamento di DeepSeek V4 Pro è esplicito e può essere attivato o disattivato, a differenza delle modalità opache dei modelli proprietari concorrenti.

Modalità Non (predefinita)
Risposta diretta senza una catena di ragionamento visibile. Latenza minima (~2–5 s a 8 tok/s). Per chat, traduzione e generazione di testo semplice.
Modalità High
Inserisce 200-2000 token di riflessione prima della risposta. +30-40 % di qualità in matematica, codice e analisi. Attivabile tramite il flag /think in Ollama o l'header thinking_mode nell'API.
Modalità Max
Ragionamento esaustivo (fino a 16k token di chain-of-thought). Si avvicina alle prestazioni di o4 su AIME 2025 (87% contro il 91% di o4). Costoso: 10-30 minuti per richiesta in locale.
Attivare la modalità thinking tramite Ollama (V4 Flash, identica per Pro)
# Mode High
ollama run deepseek-v4 "Résous : x² + 5x - 14 = 0 /think"

# Mode Max
ollama run deepseek-v4 "Démontre la conjecture de Collatz pour n<100 /think_max"

#3. Hardware richiesto in base alla quantizzazione

VRAM totale richiesta (modello + cache KV da 32k token)
QuantizationVRAM del modello+ KV 32kConfigurazioni possibili
FP16 (di riferimento)3 200 GB~3 350 GBDC: 16× H100 80GB o 8× H200 141GB. Non praticabile in locale.
Q8_01 700 GB~1 800 GBCluster di 8× H200 da 141 GB. ~250 mila dollari di hardware.
Q5_K_M1 150 GB~1 230 GBCluster di 3 Mac Studio da 512 GB, oppure 4× H200 da 141 GB.
Q4_K_M960 GB~1 040 GBCluster con 8× A100 80GB, oppure 2× Mac Studio da 512 GB collegati in uno swarm di rete.
IQ3_M (compresso)720 GB~800 GBUn solo Mac Studio 512 + offload parziale su SSD. Lento ma possibile.
IQ2_XS (estremo)480 GB~560 GBSolo Mac Studio da 512 GB, qualità fortemente degradata.
!
Realismo sull'esecuzione in locale
DeepSeek V4 Pro Q4 resta a 960 GB — è un modello per i data center, non per postazioni individuali. Se vuoi un modello di frontiera da eseguire in locale su una singola macchina nel 2026, considera DeepSeek V4 Flash (170 GB in Q4) o aspetta le distillazioni Pro→70B che arriveranno nelle prossime settimane.

#4. Installazione locale

Tre opzioni in base alla tua infrastruttura: llama.cpp per uno swarm su più macchine, vLLM per un cluster GPU omogeneo o MLX-distributed per uno swarm di Mac Studio.

#Opzione A — llama.cpp distribuito (consigliata per più macchine)

Configurazione swarm 2× Mac Studio 512 GB
# Sur chaque machine
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 GGML_RPC=1 GGML_CUDA=0

# Téléchargement modèle (split GGUF, ~960 Go)
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-GGUF \
  --include "*Q4_K_M*.gguf" --local-dir ./models

# Machine 1 (rpc-server, écoute sur :50052)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Machine 2 (rpc-server également)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Coordinator (peut être l'une des deux)
./build/bin/llama-cli \
  -m ./models/DeepSeek-V4-Pro-Q4_K_M-00001-of-00020.gguf \
  --rpc 192.168.1.10:50052,192.168.1.11:50052 \
  -ngl 99 -fa -c 32768 \
  -ctk q8_0 -ctv q8_0

#Opzione B — vLLM su cluster H100/H200

vLLM 8× H200 141GB
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Pro \
  --tensor-parallel-size 8 \
  --pipeline-parallel-size 1 \
  --max-model-len 1000000 \
  --quantization fp8 \
  --enable-prefix-caching \
  --port 8000

# Endpoint OpenAI-compatible sur :8000
curl http://localhost:8000/v1/chat/completions -d '{...}'

#Opzione C — Ollama (quando il porting sarà disponibile)

Al 25 aprile 2026, Ollama non ha ancora integrato DeepSeek V4 Pro (le versioni quantizzate Q4_K_M della community escono questo fine settimana). Segui gli aggiornamenti su ollama.com/library.

→
Costo reale dell'energia elettrica
Cluster di 8× H200 per l'inferenza di DeepSeek V4 Pro Q8: ~5,2 kW. Una sessione di 8 ore costa ~6,30 € di elettricità (FR 2026). Rispetto all'API DeepSeek ospitata a ~0,28 $/M token di output, l'esecuzione in locale diventa economicamente conveniente oltre ~50 M token/mese.

#5. Benchmark rispetto a GPT-5, Claude 4.7, Gemini 3

Punteggi pubblicati da DeepSeek (paper del 24 aprile 2026), benchmark standard pubblici
BenchmarkDeepSeek V4 Pro MaxGPT-5Claude 4.7 OpusGemini 3 Ultra
MMLU-Pro84.285.184.783.9
GPQA Diamond78.576.879.277.1
AIME 202587.082.485.680.2
LiveCodeBench v579.878.275.476.1
SWE-bench Verified59.462.163.855.7
LongBench v2 (1M)72.6—68.470.2
Humanity's Last Exam26.823.425.122.9
i
Benchmark indipendente in arrivo
Questi dati sono annunciati da DeepSeek. I benchmark indipendenti (LMSYS Arena, ARC-AGI, HLE) saranno pubblicati nelle prossime 2–4 settimane. Da monitorare per avere conferma: il modello dovrebbe comparire tra i primi 5 della Chatbot Arena entro 10 giorni.

#6. Sfruttare il contesto di 1M token

Il contesto 1M è nativo (non esteso tramite YaRN), grazie a HCA. È uno dei tre o quattro modelli a pesi aperti al mondo a offrire 1M, e l'unico a farlo con questa qualità nel recupero delle informazioni.

Needle-in-Haystack 1M
Recupero del 98 % sull'intero contesto (contro il 76 % di Gemini 1.5 Pro a parità di condizioni).
Caso d'uso 1 — Intere basi di codice
net/* del kernel Linux (~800 k token) acquisito in un'unica volta, refactoring tra file con una sola richiesta.
Caso d'uso 2 — Ricerca giuridica
Codice civile + sentenze recenti (~600 k token) nel contesto, estrazione della giurisprudenza in una sola passata.
Use case 3 — Analisi contabile
10 anni di bilanci + allegati (~400 k token), rilevazione di anomalie su più esercizi.
VRAM per la cache KV a 1M
Con KV Q4 e CSA attivo: ~280 GB. A 1M senza compressione: ~2 TB (impraticabile).

#7. Casi d'uso ideali

Ricerca scientifica
Matematica, fisica teorica, chimica computazionale. La modalità Max supera o4 su alcuni benchmark AIME/Putnam.
Sicurezza / sovranità
Banche, difesa, sanità, governo: modello di frontiera ospitato al 100 % su infrastruttura propria, con licenza MIT e sottoponibile ad audit. Nessun equivalente se non LLaMA 4 (licenza più restrittiva).
Agenti complessi a lungo termine
Il contesto 1M + ragionamento Max + 49B attivi lo rendono un agente migliore rispetto ai modelli densi più piccoli, senza il costo di inferenza di un GPT-5.
RAG su scala enterprise
Base di conoscenza composta da diversi milioni di token (codebase, documenti interni, norme ISO). Ricerca diretta senza retrieval grazie al contesto.

#Limiti e alternative

Hardware dal costo proibitivo per i privati
Min 960 GB VRAM Q4 = cluster ~80.000 € di seconda mano. Fuori portata di un privato.
Tooling maturità insufficiente a J+1
Quantizzazioni GGUF della comunità in preparazione, vLLM richiede il ramo dev, MLX-distributed è ancora sperimentale. Attendere circa 2 settimane per la stabilità.
Impronta carbonica
Cluster 8× H200 24/7 = ~45 MWh/anno. Da confrontare con l'uso delle API (che consentono un migliore ammortamento).
Alternative più accessibili
DeepSeek V4 Flash 284B (170 GB in Q4, entra nella memoria di un Mac Studio) · DeepSeek V3.2 671B (240 GB in Q2 su Mac Studio 512) · Llama 4 Behemoth (qualità simile).

#FAQ

DeepSeek V4 Pro è davvero meglio di GPT-5?+
Nei benchmark pubblicati da DeepSeek: nel complesso comparabile, talvolta superiore (AIME, GPQA, codice). Inferiore su SWE-bench (agente completo per il codice). I benchmark indipendenti di Chatbot Arena (entro 10 giorni) daranno una risposta definitiva. In ogni caso, è il primo modello open-weights per cui si può porre seriamente la domanda.
Qual è la licenza esatta di DeepSeek V4 Pro?+
Licenza MIT pura — la più permissiva. Uso commerciale, redistribuzione, fork, modifica, integrazione in un prodotto chiuso: tutto è consentito senza restrizioni né clausole stringenti di attribuzione. Più libera di Llama (che richiede >700M MAU per l'uso gratuito) o di Apache 2.0 (che richiede una citazione).
Perché 1,6T parametri se solo 49B sono attivi?+
È il trucco del MoE: si memorizzano molti esperti specializzati (256 per layer), ma se ne attivano solo 8 per token (di cui 1 condiviso). Si ottiene una qualità migliore (ogni esperto si specializza) senza sostenere il costo di inferenza di un modello denso da 1,6T. Il costo in termini di memoria rimane quello di un modello da 1,6T, ma il costo di calcolo è quello di un modello da 49B.
È possibile eseguire DeepSeek V4 Pro su un solo Mac Studio Ultra da 512 GB?+
No, non in Q4 (960 GB necessari). Possibile in IQ2_XS (~480 GB) con qualità degradata e velocità di 1-2 tok/s. Per un utilizzo pratico su una singola macchina, bisogna aspettare i modelli distillati 70B/100B oppure scegliere la variante V4 Flash 284B (170 GB in Q4).
Qual è la differenza tra le 3 modalità thinking?+
Non = nessun ragionamento esplicito, latenza minima, qualità ~Mistral Large. High = 200-2000 token di chain-of-thought prima della risposta, +30-40 % di qualità in matematica/codice/analisi. Max = fino a 16k token di riflessione, qualità ~o4, ma lento (10-30 min per richiesta su un cluster locale).
Come attivare la modalità thinking in Ollama / vLLM / API?+
Ollama: suffisso /think o /think_max nel prompt. vLLM: header X-Thinking-Mode: high|max. API ufficiale di DeepSeek: campo thinking_mode nel body JSON. Il tag <think>...</think> nella risposta delimita la catena di ragionamento.
DeepSeek V4 Pro può elaborare immagini (multimodale)?+
No, V4 Pro elabora solo testo. Una variante VL (Vision-Language) è annunciata per fine maggio 2026, basata sulla stessa architettura ma con un encoder visivo integrato. Per la visione con modelli open-weights oggi: Qwen3.5-VL o Llama 4 Vision.
I modelli distillati (70B, 32B, 14B) arrivano?+
DeepSeek ha confermato nel paper che le distillazioni verso Llama-3.3-70B e Qwen-2.5-32B base sarebbero uscite entro 4-6 settimane. Precedente: DeepSeek-R1 era stato distillato in 6 versioni (da 1.5B a 70B), alcune delle quali superano i modelli originali. Aspettati delle vere bombe.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.