Configurare DeepSeek con Ollama: guida al deployment complet
DeepSeek copre due esigenze molto diverse: generare codice (Coder) e ragionare passo dopo passo (R1). Questa guida mostra come configurare correttamente DeepSeek con Ollama — scegliere la variante giusta, regolare la temperatura e la finestra di contesto, rientrare nella VRAM disponibile e gestire più richieste in parallelo. L'obiettivo: un'inferenza stabile e veloce, senza procedere per tentativi con i parametri.
#Perché configurare DeepSeek con Ollama
Ollama gestisce al tuo posto il download dei pesi, la distribuzione GPU/CPU e l'API locale. Ottieni un server che ascolta su http://localhost:11434 e un comando unico per avviare qualsiasi variante di DeepSeek. Il resto — temperatura, dimensione del contesto, memoria — viene controllato attraverso pochi parametri che vale la pena capire piuttosto che subire.
Una buona configurazione cambia tutto: un DeepSeek R1 avviato con la temperatura sbagliata entra in loop o tronca il proprio ragionamento; un DeepSeek Coder con un contesto troppo breve dimentica metà del tuo file. L'obiettivo di questa guida è definire queste impostazioni una volta per tutte.
#DeepSeek Coder vs Chat vs R1: quale installare
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Tre famiglie convivono sotto il nome DeepSeek nella libreria Ollama. Non si configurano allo stesso modo perché sono destinate a usi diversi.
- deepseek-coder
- Specializzato nel codice: completamento, generazione di funzioni, refactoring. Disponibile in dimensioni contenute (1.3B, 6.7B, 33B). Ideale collegato a un editor per l'autocompletamento locale.
- deepseek-v3 / deepseek-llm (Chat)
- Modello conversazionale generalista. Risposte dirette, senza mostrare la catena di pensiero. Per un assistente polivalente sia in francese sia in inglese.
- deepseek-r1
- Modello di ragionamento: sviluppa una catena di pensiero (tag <think>) prima di rispondere. Eccellente in matematica, logica e problemi a più fasi. Versioni distillate 1.5B / 7B / 8B / 14B / 32B / 70B per poter essere eseguite localmente.
Regola semplice: codice mentre digiti → Coder; un assistente che conversa → Chat/V3; un problema che richiede ragionamento → R1. Nulla ti impedisce di installarli tutti e tre: Ollama li conserva uno accanto all'altro.
#Prerequisiti e VRAM per dimensione
Ollama deve essere installato e il suo servizio deve essere attivo. La quantizzazione predefinita dei modelli DeepSeek su Ollama è Q4_K_M, il miglior compromesso tra qualità e memoria per la maggior parte delle schede. Ecco la VRAM necessaria in Q4, considerando solo i pesi — prevedi da 1 a 2 GB in più per il contesto.
- 1,5B – 3B (R1 distillato)
- ≈ 2 GB · funziona anche senza GPU dedicata, o senza alcuna difficoltà su una RTX 3060 da 12 GB.
- 7B – 8B
- ≈ 5 GB · RTX 3060 12 GB, RTX 4070 12 GB. Punto di equilibrio per un uso quotidiano.
- 14B
- ≈ 9 GB · RTX 4070 12 GB con poco margine, RTX 4080 16 GB con un buon margine.
- 32B / 33B (Coder)
- ≈ 19 GB · RTX 4090 24 GB, o Mac con memoria unificata 24-48 GB.
- 70B
- ≈ 40 GB · due GPU da 24 GB, o un Mac M4 Pro da 48 GB e oltre.
#Installare e avviare DeepSeek
- 01Verificare che Ollama sia in esecuzioneIl servizio deve essere avviato. `ollama --version` conferma l'installazione; il server ascolta sulla porta 11434.
- 02Scaricare il modelloScegli la versione e la dimensione con `ollama pull`. L'etichetta dopo il : definisce la dimensione (es. :7b, :14b, :32b). Senza etichetta, Ollama prende la dimensione predefinita.
- 03Avviare una sessione`ollama run` scarica il modello se necessario, poi apre un prompt interattivo. Digita /bye per uscire.
- 04Testare l'APILo stesso modello è immediatamente disponibile tramite l'API REST locale, pronta per essere collegata a Open WebUI, a un editor o ai tuoi script.
#Regolare temperatura e finestra di contesto
I due parametri che più influiscono sulla qualità sono la temperatura (creatività vs determinismo) e num_ctx (dimensione della finestra di contesto). I valori predefiniti di Ollama non sono sempre ideali, soprattutto per R1.
- temperature (R1)
- Da 0,5 a 0,7. DeepSeek raccomanda circa 0,6 per R1: se il valore è troppo basso, il ragionamento si blocca; se è troppo alto, divaga. Evita 0 su un modello di ragionamento.
- temperature (Coder)
- Da 0.1 a 0.3. Per il codice, vogliamo determinismo e riproducibilità, non creatività.
- num_ctx
- Dimensione del contesto in token. Il valore predefinito è spesso 4096. Aumentalo a 8192 o 16384 per file lunghi o lunghe catene di ragionamento, al prezzo di un maggiore consumo di VRAM.
- top_p
- Circa 0.95. Da lasciare invariato nella maggior parte dei casi; regola prima la temperatura.
- repeat_penalty
- 1.1 di default. Utile se R1 si ripete in loop nella sua catena di pensiero.
#Fissare la configurazione con un Modelfile
Regolare i parametri a ogni sessione è fastidioso. Un Modelfile crea una variante con un nome che include le tue impostazioni e un system prompt. Ottieni un modello pronto all'uso, richiamabile come qualsiasi altro.
Lo stesso approccio vale per R1: un Modelfile con temperature 0.6 e num_ctx 16384 ti dà un modello di ragionamento calibrato, senza doverci pensare a ogni avvio.
#Ottimizzare la VRAM e la memoria
Se un modello non entra interamente nella VRAM, Ollama sposta i layer in eccesso sulla CPU — e il numero di token al secondo crolla. Tre accorgimenti per mantenere l’esecuzione interamente sulla GPU.
- Diminuire la quantizzazione
- Q4_K_M per impostazione predefinita. Mantieni questo livello: è già il giusto compromesso. Passa a Q5_K_M o Q8_0 solo se la VRAM lo consente e cerchi un livello di qualità superiore.
- Scegliere la dimensione giusta
- Un 14B eseguito interamente sulla GPU supera un 32B eseguito in parte sulla CPU, sia in velocità sia in comodità d'uso. Punta al modello più grande che rientra interamente nella VRAM.
- Controllare num_ctx
- La cache KV cresce con il contesto. Un contesto ragionevole (8192) libera spazio per i pesi del modello.
- Rimuovere dalla memoria dopo l'uso
- OLLAMA_KEEP_ALIVE regola per quanto tempo un modello rimane in memoria dopo l'ultima richiesta. Riduci questo valore per liberare la GPU più velocemente tra due modelli.
#Esecuzione parallela e concorrenza
Ollama può gestire più richieste contemporaneamente e mantenere più modelli caricati insieme. Utile per un assistente condiviso, o per eseguire Coder e R1 contemporaneamente. Due variabili d'ambiente controllano questo comportamento.
- OLLAMA_NUM_PARALLEL
- Numero di richieste elaborate in parallelo da uno stesso modello. Ogni richiesta consuma la propria quota di contesto, quindi di VRAM. Aumenta il valore con cautela (2, 4) in base alla scheda.
- OLLAMA_MAX_LOADED_MODELS
- Numero di modelli distinti mantenuti in memoria contemporaneamente. Imposta il valore a 2 per mantenere Coder e R1 entrambi pronti all'uso, se la VRAM lo permette.
#Risoluzione dei problemi comuni
- R1 gira in loop in <think>
- Temperatura troppo bassa o repeat_penalty mancante. Aumenta temperature a 0.6 e aggiungi repeat_penalty 1.1.
- Generazione molto lenta
- Il modello viene eseguito in parte sulla CPU. Verifica `ollama ps`: se PROCESSOR non indica 100% GPU, riduci la dimensione, la quantizzazione o num_ctx.
- Risposta troncata
- num_predict (numero massimo di token generati) troppo basso, o contesto saturato. Aumenta num_ctx e lascia num_predict libero (-1).
- Il codice viene generato con i tag di ragionamento
- Stai usando R1 per il codice. Passa a deepseek-coder, che non produce una catena di pensiero.
#Per approfondire
Una volta configurato e calibrato DeepSeek, ecco i passi successivi naturali: approfondire R1, affinare le tue varianti e scegliere la quantizzazione in base alla tua scheda grafica.
- Installare DeepSeek R1 con Ollama
- La guida dedicata al modello di ragionamento, alle versioni distillate e alla chain of thought, per andare oltre la configurazione.
- Personalizzare un modello con Ollama Modelfile
- Sistema di template, prompt di sistema e parametri — per industrializzare le varianti viste qui.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Comprendere i compromessi tra qualità e VRAM per far entrare nella tua GPU il modello DeepSeek più grande possibile.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.