Intermedio 15 minStrumenti

Configurare DeepSeek con Ollama: guida al deployment complet

DeepSeek copre due esigenze molto diverse: generare codice (Coder) e ragionare passo dopo passo (R1). Questa guida mostra come configurare correttamente DeepSeek con Ollama — scegliere la variante giusta, regolare la temperatura e la finestra di contesto, rientrare nella VRAM disponibile e gestire più richieste in parallelo. L'obiettivo: un'inferenza stabile e veloce, senza procedere per tentativi con i parametri.

Di Mohamed Meguedmi·Agg. 2026-08-28·Testato su Windows, macOS e Linux

#Perché configurare DeepSeek con Ollama

Ollama gestisce al tuo posto il download dei pesi, la distribuzione GPU/CPU e l'API locale. Ottieni un server che ascolta su http://localhost:11434 e un comando unico per avviare qualsiasi variante di DeepSeek. Il resto — temperatura, dimensione del contesto, memoria — viene controllato attraverso pochi parametri che vale la pena capire piuttosto che subire.

Una buona configurazione cambia tutto: un DeepSeek R1 avviato con la temperatura sbagliata entra in loop o tronca il proprio ragionamento; un DeepSeek Coder con un contesto troppo breve dimentica metà del tuo file. L'obiettivo di questa guida è definire queste impostazioni una volta per tutte.

#DeepSeek Coder vs Chat vs R1: quale installare

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Tre famiglie convivono sotto il nome DeepSeek nella libreria Ollama. Non si configurano allo stesso modo perché sono destinate a usi diversi.

deepseek-coder
Specializzato nel codice: completamento, generazione di funzioni, refactoring. Disponibile in dimensioni contenute (1.3B, 6.7B, 33B). Ideale collegato a un editor per l'autocompletamento locale.
deepseek-v3 / deepseek-llm (Chat)
Modello conversazionale generalista. Risposte dirette, senza mostrare la catena di pensiero. Per un assistente polivalente sia in francese sia in inglese.
deepseek-r1
Modello di ragionamento: sviluppa una catena di pensiero (tag <think>) prima di rispondere. Eccellente in matematica, logica e problemi a più fasi. Versioni distillate 1.5B / 7B / 8B / 14B / 32B / 70B per poter essere eseguite localmente.
i
R1: si tratta di distillazioni
Le versioni da 7B a 70B di deepseek-r1 su Ollama sono distillazioni basate su Qwen e Llama, non il modello completo da 671B. È questo che permette di eseguirle su una scheda grafica consumer — conservando parte delle capacità di ragionamento del fratello maggiore.

Regola semplice: codice mentre digiti → Coder; un assistente che conversa → Chat/V3; un problema che richiede ragionamento → R1. Nulla ti impedisce di installarli tutti e tre: Ollama li conserva uno accanto all'altro.

#Prerequisiti e VRAM per dimensione

Ollama deve essere installato e il suo servizio deve essere attivo. La quantizzazione predefinita dei modelli DeepSeek su Ollama è Q4_K_M, il miglior compromesso tra qualità e memoria per la maggior parte delle schede. Ecco la VRAM necessaria in Q4, considerando solo i pesi — prevedi da 1 a 2 GB in più per il contesto.

1,5B – 3B (R1 distillato)
≈ 2 GB · funziona anche senza GPU dedicata, o senza alcuna difficoltà su una RTX 3060 da 12 GB.
7B – 8B
≈ 5 GB · RTX 3060 12 GB, RTX 4070 12 GB. Punto di equilibrio per un uso quotidiano.
14B
≈ 9 GB · RTX 4070 12 GB con poco margine, RTX 4080 16 GB con un buon margine.
32B / 33B (Coder)
≈ 19 GB · RTX 4090 24 GB, o Mac con memoria unificata 24-48 GB.
70B
≈ 40 GB · due GPU da 24 GB, o un Mac M4 Pro da 48 GB e oltre.
→
Controllare prima di scaricare
Esegui `ollama ps` dopo un primo test: la colonna PROCESSOR indica 100% GPU se il modello entra interamente nella VRAM, oppure una ripartizione GPU/CPU se ne supera la capacità. Una ripartizione = un netto rallentamento; passa quindi a un modello di taglia inferiore o a una quantizzazione più bassa.

#Installare e avviare DeepSeek

  1. 01
    Verificare che Ollama sia in esecuzione
    Il servizio deve essere avviato. `ollama --version` conferma l'installazione; il server ascolta sulla porta 11434.
  2. 02
    Scaricare il modello
    Scegli la versione e la dimensione con `ollama pull`. L'etichetta dopo il : definisce la dimensione (es. :7b, :14b, :32b). Senza etichetta, Ollama prende la dimensione predefinita.
  3. 03
    Avviare una sessione
    `ollama run` scarica il modello se necessario, poi apre un prompt interattivo. Digita /bye per uscire.
  4. 04
    Testare l'API
    Lo stesso modello è immediatamente disponibile tramite l'API REST locale, pronta per essere collegata a Open WebUI, a un editor o ai tuoi script.
Terminale — scaricare e avviare
# Modèle de raisonnement, distillation 7B
ollama pull deepseek-r1:7b

# Modèle de code, 6.7B
ollama pull deepseek-coder:6.7b

# Lancer une session interactive
ollama run deepseek-r1:7b

# Voir ce qui est chargé et où (GPU/CPU)
ollama ps
Terminale — chiamata all'API REST
curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:7b",
  "prompt": "Explique la récursivité en une phrase.",
  "stream": false
}'

#Regolare temperatura e finestra di contesto

I due parametri che più influiscono sulla qualità sono la temperatura (creatività vs determinismo) e num_ctx (dimensione della finestra di contesto). I valori predefiniti di Ollama non sono sempre ideali, soprattutto per R1.

temperature (R1)
Da 0,5 a 0,7. DeepSeek raccomanda circa 0,6 per R1: se il valore è troppo basso, il ragionamento si blocca; se è troppo alto, divaga. Evita 0 su un modello di ragionamento.
temperature (Coder)
Da 0.1 a 0.3. Per il codice, vogliamo determinismo e riproducibilità, non creatività.
num_ctx
Dimensione del contesto in token. Il valore predefinito è spesso 4096. Aumentalo a 8192 o 16384 per file lunghi o lunghe catene di ragionamento, al prezzo di un maggiore consumo di VRAM.
top_p
Circa 0.95. Da lasciare invariato nella maggior parte dei casi; regola prima la temperatura.
repeat_penalty
1.1 di default. Utile se R1 si ripete in loop nella sua catena di pensiero.
Sessione interattiva — regolare in tempo reale
ollama run deepseek-r1:7b
>>> /set parameter temperature 0.6
>>> /set parameter num_ctx 8192
>>> Résous : un train part à 60 km/h...
>>> /bye
API — parametri per richiesta
{
  "model": "deepseek-coder:6.7b",
  "prompt": "Écris une fonction Python de tri fusion.",
  "options": {
    "temperature": 0.2,
    "num_ctx": 8192,
    "top_p": 0.95
  },
  "stream": false
}
!
num_ctx costa memoria
Raddoppiare la finestra di contesto aumenta sensibilmente la VRAM occupata dalla cache KV. Su una scheda con una capacità appena sufficiente, passare da 4096 a 16384 può trasferire parte del modello alla CPU. Aumenta il contesto solo se ne hai davvero bisogno.

#Fissare la configurazione con un Modelfile

Regolare i parametri a ogni sessione è fastidioso. Un Modelfile crea una variante con un nome che include le tue impostazioni e un system prompt. Ottieni un modello pronto all'uso, richiamabile come qualsiasi altro.

Modelfile — deepseek-coder-fr
FROM deepseek-coder:6.7b

PARAMETER temperature 0.2
PARAMETER num_ctx 8192
PARAMETER top_p 0.95

SYSTEM """Tu es un assistant de programmation.
Réponds en français, commente le code, et privilégie la clarté."""
Terminale — creare e utilizzare la variante
# Créer le modèle à partir du fichier
ollama create deepseek-coder-fr -f ./Modelfile

# L'utiliser comme n'importe quel modèle
ollama run deepseek-coder-fr

Lo stesso approccio vale per R1: un Modelfile con temperature 0.6 e num_ctx 16384 ti dà un modello di ragionamento calibrato, senza doverci pensare a ogni avvio.

#Ottimizzare la VRAM e la memoria

Se un modello non entra interamente nella VRAM, Ollama sposta i layer in eccesso sulla CPU — e il numero di token al secondo crolla. Tre accorgimenti per mantenere l’esecuzione interamente sulla GPU.

Diminuire la quantizzazione
Q4_K_M per impostazione predefinita. Mantieni questo livello: è già il giusto compromesso. Passa a Q5_K_M o Q8_0 solo se la VRAM lo consente e cerchi un livello di qualità superiore.
Scegliere la dimensione giusta
Un 14B eseguito interamente sulla GPU supera un 32B eseguito in parte sulla CPU, sia in velocità sia in comodità d'uso. Punta al modello più grande che rientra interamente nella VRAM.
Controllare num_ctx
La cache KV cresce con il contesto. Un contesto ragionevole (8192) libera spazio per i pesi del modello.
Rimuovere dalla memoria dopo l'uso
OLLAMA_KEEP_ALIVE regola per quanto tempo un modello rimane in memoria dopo l'ultima richiesta. Riduci questo valore per liberare la GPU più velocemente tra due modelli.
Terminale — liberare rapidamente la GPU
# Garder les modèles chargés 2 minutes seulement (défaut : 5 min)
export OLLAMA_KEEP_ALIVE=2m

# Décharger immédiatement un modèle précis
ollama stop deepseek-r1:7b

#Esecuzione parallela e concorrenza

Ollama può gestire più richieste contemporaneamente e mantenere più modelli caricati insieme. Utile per un assistente condiviso, o per eseguire Coder e R1 contemporaneamente. Due variabili d'ambiente controllano questo comportamento.

OLLAMA_NUM_PARALLEL
Numero di richieste elaborate in parallelo da uno stesso modello. Ogni richiesta consuma la propria quota di contesto, quindi di VRAM. Aumenta il valore con cautela (2, 4) in base alla scheda.
OLLAMA_MAX_LOADED_MODELS
Numero di modelli distinti mantenuti in memoria contemporaneamente. Imposta il valore a 2 per mantenere Coder e R1 entrambi pronti all'uso, se la VRAM lo permette.
Terminale — avviare con elaborazione concorrente
# Servir 4 requêtes en parallèle, 2 modèles chargés
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=2

# Redémarrer le service pour prendre en compte les variables
ollama serve
!
Il parallelismo si paga in VRAM
Ogni richiesta parallela e ogni modello caricato occupa una propria porzione di memoria. Su una scheda con memoria appena sufficiente, aumentare questi valori porta rapidamente a usare la CPU. Verifica con `ollama ps` dopo aver aumentato i valori e riducili se PROCESSOR non mostra più 100% GPU.

#Risoluzione dei problemi comuni

R1 gira in loop in <think>
Temperatura troppo bassa o repeat_penalty mancante. Aumenta temperature a 0.6 e aggiungi repeat_penalty 1.1.
Generazione molto lenta
Il modello viene eseguito in parte sulla CPU. Verifica `ollama ps`: se PROCESSOR non indica 100% GPU, riduci la dimensione, la quantizzazione o num_ctx.
Risposta troncata
num_predict (numero massimo di token generati) troppo basso, o contesto saturato. Aumenta num_ctx e lascia num_predict libero (-1).
Il codice viene generato con i tag di ragionamento
Stai usando R1 per il codice. Passa a deepseek-coder, che non produce una catena di pensiero.

#Per approfondire

Una volta configurato e calibrato DeepSeek, ecco i passi successivi naturali: approfondire R1, affinare le tue varianti e scegliere la quantizzazione in base alla tua scheda grafica.

Installare DeepSeek R1 con Ollama
La guida dedicata al modello di ragionamento, alle versioni distillate e alla chain of thought, per andare oltre la configurazione.
Personalizzare un modello con Ollama Modelfile
Sistema di template, prompt di sistema e parametri — per industrializzare le varianti viste qui.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Comprendere i compromessi tra qualità e VRAM per far entrare nella tua GPU il modello DeepSeek più grande possibile.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.