Installare DeepSeek R1 con Ollama
DeepSeek R1 è un modello di ragionamento a catena di pensiero pubblicato da DeepSeek con licenza MIT. Il modello completo conta 671 miliardi di parametri e resta fuori dalla portata di un computer personale, ma le versioni distillate (da 1,5B a 70B) trovano comodamente spazio su hardware consumer. Questo tutorial mostra come installare DeepSeek R1 con Ollama, scegliere la dimensione giusta e sfruttare la modalità di ragionamento.
#Perché DeepSeek R1?
R1 non è un LLM "classico": prima di rispondere, genera una catena di ragionamento visibile, delimitata dai tag <think>...</think>. È questa fase che gli permette di risolvere problemi di matematica, logica o codice che i modelli a generazione diretta spesso non riescono a risolvere. Su AIME 2024 e MATH-500, i distillati 14B e 32B superano ampiamente Llama 3.1 70B Instruct, che pesa però da 2 a 5 volte di più.
L'altro vantaggio: la licenza MIT, senza restrizioni di uso commerciale o geografico. Puoi integrare R1 in un prodotto, un agente, uno strumento interno, senza chiedere permesso a nessuno. È raro per un modello di ragionamento di questo livello.
#Le versioni distillate disponibili
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Ollama distribuisce sette dimensioni di modello sotto lo stesso nome deepseek-r1. Il tag predefinito punta alla versione distillata da 7B (basata su Qwen 7B).
- deepseek-r1:1.5b
- Basato su Qwen 2.5 Math 1.5B. Leggero, perfetto per fare prove su un laptop senza GPU. Qualità limitata sui problemi complessi.
- deepseek-r1:7b
- Base Qwen 2.5 Math 7B. Tag predefinito. Buon compromesso per 8 GB di VRAM. Eccellente punto di partenza.
- deepseek-r1:8b
- Base Llama 3.1 8B. Leggermente più loquace della 7B, migliore in francese.
- deepseek-r1:14b
- Base Qwen 2.5 14B. Salto di qualità notevole in matematica. Sweet spot per 12 GB di VRAM.
- deepseek-r1:32b
- Basato su Qwen 2.5 32B. Al livello di o1-mini sulla maggior parte dei benchmark di ragionamento. Richiede 24 GB di VRAM in Q4.
- deepseek-r1:70b
- Base Llama 3.3 70B. Il più potente dei distillati. RTX 5090 32 GB o Mac Studio 64 GB+
- deepseek-r1:671b
- Il modello completo (MoE 671B, 37B attivi). Fuori portata per un normale computer personale, ma eseguibile su un Mac Studio Ultra con 512 GB.
#Prerequisiti e VRAM per dimensione
Prima di installare DeepSeek R1 con Ollama, verifica che Ollama sia installato (il daemon è in ascolto per impostazione predefinita su http://localhost:11434) e che la tua GPU abbia memoria sufficiente per la dimensione desiderata. Ecco i requisiti di VRAM per la quantizzazione Q4_K_M, quella che Ollama scarica per impostazione predefinita.
- 1.5B Q4
- ~1,1 GB di VRAM. Funziona su qualsiasi GPU o persino usando solo la CPU (15-25 tok/s).
- 7B Q4
- ~4,7 GB VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
- 8B Q4
- ~5,2 GB di VRAM. Stesso target del 7B, margine più ridotto su 6 GB.
- 14B Q4
- ~9 GB VRAM. RTX 3060 12 GB, 4070 12 GB, M2 Pro 16 GB.
- 32B Q4
- ~19 GB VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
- 70B Q4
- ~40 GB VRAM. RTX 5090 32 GB con offload, Mac Studio Ultra 64 GB+.
#1. Installare il modello
Basta un solo comando. Ollama scarica i pesi dal suo registro ufficiale e carica il modello in memoria al primo utilizzo.
Per una dimensione precisa, aggiungi il tag :
Al primo avvio viene scaricato il modello (da 1 GB per la versione 1.5B a 40 GB per la versione 70B). Gli avvii successivi sono istantanei finché il modello rimane nella cache di Ollama.
#2. Scegliere la dimensione
La scelta della dimensione dipende da tre variabili: la VRAM, il tipo di compiti e la tua tolleranza all'attesa. R1 genera in media tra 500 e 2000 token di ragionamento prima della risposta finale — quindi sono da 3 a 10 volte più token rispetto a un modello di chat classico con generazione diretta. La velocità conta veramente.
- Testare R1 senza una GPU di alto livello
- 1,5B o 7B. Latenza accettabile per la chat anche usando solo la CPU.
- Matematica di livello liceale / Python semplice
- 7B o 8B. Sufficiente nell'80% dei casi, delude nell'algebra avanzata.
- Matematica impegnativa, logica, ragionamenti lunghi
- Minimo 14B. Salto netto tra 8B e 14B su AIME e MATH-500.
- Livello o1-mini, debug complesso, dimostrazioni
- 32B. È la scelta ideale se hai 24 GB di VRAM.
- Il massimo possibile in locale
- 70B Q4 su RTX 5090 con offload o Mac Studio 64 GB+.
#3. Primo prompt di ragionamento
R1 eccelle nei problemi che richiedono più passaggi. Mettiamolo alla prova con un classico dell'AIME, alla portata della versione 14B:
Nota bene la struttura: tutto ciò che si trova tra <think> e </think> è la catena di pensiero del modello. Puoi mostrarla all'utente finale, nasconderla o registrarla nei log per il debug. È un ottimo strumento per rendere un'app più spiegabile.
#4. Q4 vs Q8: scegliere la quantizzazione
Per impostazione predefinita, Ollama scarica la Q4_K_M (compromesso qualità/memoria consigliato). Per i modelli di ragionamento, alcuni preferiscono passare a Q8_0: il degrado della qualità nella catena di pensiero si avverte di più rispetto a una normale chat.
- Q4_K_M
- Compromesso predefinito. Qualità inferiore del 2–4% rispetto a FP16 nei benchmark di matematica. È la scelta da fare come prima opzione.
- Q5_K_M
- +1 % di qualità rispetto a Q4, +25 % di memoria. Interessante se hai margine nella VRAM senza poter passare a un modello di dimensioni maggiori.
- Q8_0
- Qualità quasi-FP16 (-0,5 %). Memoria raddoppiata rispetto a Q4. Consigliato se vuoi il top su 14B o 32B e hai la VRAM.
- FP16
- Riferimento a piena precisione. Nessun vantaggio pratico rispetto a Q8 sui modelli distillati, e 4 volte più pesante di Q4.
#DeepSeek R1 vs Qwen 3.8 27B
Qwen 3.8 27B, rilasciato il 14 agosto 2026 dal team Qwen, è il modello generalista open-weight di riferimento del 2026: 262k token di contesto, visione, licenza Apache 2.0 e soprattutto una modalità di ragionamento integrata. È l'alternativa naturale a R1 quando si vuole un solo modello in grado di ragionare E di fare tutto il resto. Quale scegliere?
- DeepSeek R1 32B
- Specialista del ragionamento puro. Migliore sui benchmark di matematica (AIME, MATH-500). Ragionamento sempre visibile e facile da analizzare tramite <think>...</think>. Fa solo questo, ma lo fa molto bene.
- Qwen 3.8 27B
- Modello generalista del 2026 con ragionamento integrato. Contesto 262k, visione, Apache 2.0, ~18 GB in Q4. Per impostazione predefinita ragiona troppo: anche per una domanda semplice, sviluppa una lunga catena di pensiero inutile. Imposta il suo livello di ragionamento su low per tornare a ottenere risposte dirette.
- Verdetto pratico
- R1 32B resta in vantaggio nella matematica e nella logica pure e per un formato di ragionamento stabile e registrabile nei log. Qwen 3.8 27B vince quando vuoi un modello polivalente (codice, chat, visione, contesto lungo) che ragioni su richiesta. Per il francese, entrambi sono solidi.
- Risorse
- Comparabili. R1 32B entra in 24 GB in Q4 (RTX 3090/4090). Qwen 3.8 27B è un po' più leggero (~18 GB in Q4) e lascia più margine per il contesto sulla stessa scheda.
#Risoluzione dei problemi
- Modello che non mostra il <think>
- Potresti stai usando un client che nasconde le etichette XML. Prova con ollama run en CLI per verificare che il modello le generi correttamente. Se l'API JSON le interrompe, è un problema del client.
- Risposte troncate
- Il contesto predefinito di Ollama è di 4096 token. R1 ne consuma molti per il ragionamento. Aumentalo: /set parameter num_ctx 16384 nella sessione, oppure tramite il parametro options.num_ctx nell'API.
- Molto lento nonostante una buona GPU
- Verifica con ollama ps che il modello sia ben 100 % GPU. Se la colonna PROCESSOR mostra del CPU, stai sforando in RAM. Scendi di una dimensione o passa a una quantizzazione più aggressiva.
- Il modello entra in un ciclo ripetitivo nella sua catena di pensiero
- È tipico dei piccoli modelli distillati (1.5B, 7B) alle prese con problemi troppo difficili. Passa a un modello più grande, oppure poni un problema più semplice, oppure aggiungi al tuo prompt «rispondi in meno di 500 token di ragionamento».
- Errore "insufficient memory"
- Modello troppo grande per la tua VRAM. ollama rm deepseek-r1:32b poi ollama pull deepseek-r1:14b. Puoi anche forzare un offload parziale con OLLAMA_GPU_LAYERS.
#Per approfondire
Alcune idee per proseguire dopo questa installazione:
- Comprendere le quantizzazioni
- La guida Q4/Q5/Q8 del sito illustra nel dettaglio i compromessi ed è utile prima di passare a un modello più grande.
- Scegliere la propria GPU per R1
- Se punti seriamente alla versione 32B, la guida all'acquisto delle GPU indica le soglie di 24/32 GB a cui puntare nel 2026.
- Collegare R1 a un'interfaccia
- Open WebUI o LM Studio gestiscono nativamente i tag <think> e permettono di comprimere ed espandere il ragionamento.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.