Principiante 8 minOllama

Installare DeepSeek R1 con Ollama

DeepSeek R1 è un modello di ragionamento a catena di pensiero pubblicato da DeepSeek con licenza MIT. Il modello completo conta 671 miliardi di parametri e resta fuori dalla portata di un computer personale, ma le versioni distillate (da 1,5B a 70B) trovano comodamente spazio su hardware consumer. Questo tutorial mostra come installare DeepSeek R1 con Ollama, scegliere la dimensione giusta e sfruttare la modalità di ragionamento.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché DeepSeek R1?

R1 non è un LLM "classico": prima di rispondere, genera una catena di ragionamento visibile, delimitata dai tag <think>...</think>. È questa fase che gli permette di risolvere problemi di matematica, logica o codice che i modelli a generazione diretta spesso non riescono a risolvere. Su AIME 2024 e MATH-500, i distillati 14B e 32B superano ampiamente Llama 3.1 70B Instruct, che pesa però da 2 a 5 volte di più.

L'altro vantaggio: la licenza MIT, senza restrizioni di uso commerciale o geografico. Puoi integrare R1 in un prodotto, un agente, uno strumento interno, senza chiedere permesso a nessuno. È raro per un modello di ragionamento di questo livello.

i
Distillazione, in due parole
Il modello completo R1 (671B MoE) ha generato milioni di esempi di ragionamento, che sono poi stati utilizzati per fine-tunare modelli più piccoli (Qwen 7B/14B/32B e Llama 8B/70B). I distillati non sono quindi R1 stesso, ma Qwen/Llama che hanno imparato a ragionare come R1.

#Le versioni distillate disponibili

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Ollama distribuisce sette dimensioni di modello sotto lo stesso nome deepseek-r1. Il tag predefinito punta alla versione distillata da 7B (basata su Qwen 7B).

deepseek-r1:1.5b
Basato su Qwen 2.5 Math 1.5B. Leggero, perfetto per fare prove su un laptop senza GPU. Qualità limitata sui problemi complessi.
deepseek-r1:7b
Base Qwen 2.5 Math 7B. Tag predefinito. Buon compromesso per 8 GB di VRAM. Eccellente punto di partenza.
deepseek-r1:8b
Base Llama 3.1 8B. Leggermente più loquace della 7B, migliore in francese.
deepseek-r1:14b
Base Qwen 2.5 14B. Salto di qualità notevole in matematica. Sweet spot per 12 GB di VRAM.
deepseek-r1:32b
Basato su Qwen 2.5 32B. Al livello di o1-mini sulla maggior parte dei benchmark di ragionamento. Richiede 24 GB di VRAM in Q4.
deepseek-r1:70b
Base Llama 3.3 70B. Il più potente dei distillati. RTX 5090 32 GB o Mac Studio 64 GB+
deepseek-r1:671b
Il modello completo (MoE 671B, 37B attivi). Fuori portata per un normale computer personale, ma eseguibile su un Mac Studio Ultra con 512 GB.

#Prerequisiti e VRAM per dimensione

Prima di installare DeepSeek R1 con Ollama, verifica che Ollama sia installato (il daemon è in ascolto per impostazione predefinita su http://localhost:11434) e che la tua GPU abbia memoria sufficiente per la dimensione desiderata. Ecco i requisiti di VRAM per la quantizzazione Q4_K_M, quella che Ollama scarica per impostazione predefinita.

1.5B Q4
~1,1 GB di VRAM. Funziona su qualsiasi GPU o persino usando solo la CPU (15-25 tok/s).
7B Q4
~4,7 GB VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
8B Q4
~5,2 GB di VRAM. Stesso target del 7B, margine più ridotto su 6 GB.
14B Q4
~9 GB VRAM. RTX 3060 12 GB, 4070 12 GB, M2 Pro 16 GB.
32B Q4
~19 GB VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
70B Q4
~40 GB VRAM. RTX 5090 32 GB con offload, Mac Studio Ultra 64 GB+.
→
Non sai quanta VRAM hai?
Su Windows, apri Gestione attività, scheda Prestazioni > GPU. Su Linux: nvidia-smi per NVIDIA, rocm-smi per AMD. Su Mac: la memoria è unificata, considera circa il 75% della RAM totale come VRAM utilizzabile per il LLM.

#1. Installare il modello

Basta un solo comando. Ollama scarica i pesi dal suo registro ufficiale e carica il modello in memoria al primo utilizzo.

Installare la versione 7B predefinita
ollama run deepseek-r1

Per una dimensione precisa, aggiungi il tag :

Scegliere esplicitamente una dimensione
# Version la plus légère (1.5B)
ollama run deepseek-r1:1.5b

# Sweet spot 12 Go VRAM
ollama run deepseek-r1:14b

# Pour RTX 3090/4090
ollama run deepseek-r1:32b

Al primo avvio viene scaricato il modello (da 1 GB per la versione 1.5B a 40 GB per la versione 70B). Gli avvii successivi sono istantanei finché il modello rimane nella cache di Ollama.

!
Nessun :cloud, mai
Se vedi deepseek-r1:cloud da qualche parte, ignoralo: è un tag che instrada le richieste verso i server Ollama Cloud e prevede una fatturazione a consumo. Per mantenere tutto rigorosamente ospitato in proprio, usa soltanto i tag numerati (1.5b, 7b, 14b, 32b, 70b).

#2. Scegliere la dimensione

La scelta della dimensione dipende da tre variabili: la VRAM, il tipo di compiti e la tua tolleranza all'attesa. R1 genera in media tra 500 e 2000 token di ragionamento prima della risposta finale — quindi sono da 3 a 10 volte più token rispetto a un modello di chat classico con generazione diretta. La velocità conta veramente.

Testare R1 senza una GPU di alto livello
1,5B o 7B. Latenza accettabile per la chat anche usando solo la CPU.
Matematica di livello liceale / Python semplice
7B o 8B. Sufficiente nell'80% dei casi, delude nell'algebra avanzata.
Matematica impegnativa, logica, ragionamenti lunghi
Minimo 14B. Salto netto tra 8B e 14B su AIME e MATH-500.
Livello o1-mini, debug complesso, dimostrazioni
32B. È la scelta ideale se hai 24 GB di VRAM.
Il massimo possibile in locale
70B Q4 su RTX 5090 con offload o Mac Studio 64 GB+.
→
Regola semplice
Inizia con la 14B se hai 12 GB di VRAM. È il livello in cui R1 diventa veramente interessante. La 7B serve soprattutto a prendere confidenza.

#3. Primo prompt di ragionamento

R1 eccelle nei problemi che richiedono più passaggi. Mettiamolo alla prova con un classico dell'AIME, alla portata della versione 14B:

Esempio di matematica
>>> Un train part de Lyon à 8h à 90 km/h vers Paris.
... Un autre part de Paris à 9h à 110 km/h vers Lyon.
... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ?

<think>
À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km
entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h.
Temps avant croisement : 370 / 200 = 1,85 h = 1h51min.
Donc croisement à 9h + 1h51 = 10h51.
</think>

Les deux trains se croisent à 10h51.

Nota bene la struttura: tutto ciò che si trova tra <think> e </think> è la catena di pensiero del modello. Puoi mostrarla all'utente finale, nasconderla o registrarla nei log per il debug. È un ottimo strumento per rendere un'app più spiegabile.

i
Non eliminare il <think>
La tentazione classica: aggiungere un system prompt che dice "non generare una catena di pensiero". Una cattiva idea: la qualità crolla. Il ragionamento È il modello. Nascondi il blocco nell'interfaccia utente anziché eliminarlo durante la generazione.

#4. Q4 vs Q8: scegliere la quantizzazione

Per impostazione predefinita, Ollama scarica la Q4_K_M (compromesso qualità/memoria consigliato). Per i modelli di ragionamento, alcuni preferiscono passare a Q8_0: il degrado della qualità nella catena di pensiero si avverte di più rispetto a una normale chat.

Tag di quantizzazione Ollama
# Q4_K_M (défaut) — recommandé pour 80 % des cas
ollama pull deepseek-r1:14b

# Q8_0 — qualité maximale, mémoire doublée
ollama pull deepseek-r1:14b-q8_0

# Liste complète des tags disponibles
ollama show deepseek-r1:14b --modelfile
Q4_K_M
Compromesso predefinito. Qualità inferiore del 2–4% rispetto a FP16 nei benchmark di matematica. È la scelta da fare come prima opzione.
Q5_K_M
+1 % di qualità rispetto a Q4, +25 % di memoria. Interessante se hai margine nella VRAM senza poter passare a un modello di dimensioni maggiori.
Q8_0
Qualità quasi-FP16 (-0,5 %). Memoria raddoppiata rispetto a Q4. Consigliato se vuoi il top su 14B o 32B e hai la VRAM.
FP16
Riferimento a piena precisione. Nessun vantaggio pratico rispetto a Q8 sui modelli distillati, e 4 volte più pesante di Q4.
→
Q4 14B > Q8 7B
Quando sei indeciso tra una quantizzazione a più bit e un modello più grande, scegli sempre il modello più grande. Un modello 14B Q4 supera sistematicamente un 7B Q8 nel ragionamento, usando all'incirca la stessa quantità di VRAM.

#DeepSeek R1 vs Qwen 3.8 27B

Qwen 3.8 27B, rilasciato il 14 agosto 2026 dal team Qwen, è il modello generalista open-weight di riferimento del 2026: 262k token di contesto, visione, licenza Apache 2.0 e soprattutto una modalità di ragionamento integrata. È l'alternativa naturale a R1 quando si vuole un solo modello in grado di ragionare E di fare tutto il resto. Quale scegliere?

DeepSeek R1 32B
Specialista del ragionamento puro. Migliore sui benchmark di matematica (AIME, MATH-500). Ragionamento sempre visibile e facile da analizzare tramite <think>...</think>. Fa solo questo, ma lo fa molto bene.
Qwen 3.8 27B
Modello generalista del 2026 con ragionamento integrato. Contesto 262k, visione, Apache 2.0, ~18 GB in Q4. Per impostazione predefinita ragiona troppo: anche per una domanda semplice, sviluppa una lunga catena di pensiero inutile. Imposta il suo livello di ragionamento su low per tornare a ottenere risposte dirette.
Verdetto pratico
R1 32B resta in vantaggio nella matematica e nella logica pure e per un formato di ragionamento stabile e registrabile nei log. Qwen 3.8 27B vince quando vuoi un modello polivalente (codice, chat, visione, contesto lungo) che ragioni su richiesta. Per il francese, entrambi sono solidi.
Risorse
Comparabili. R1 32B entra in 24 GB in Q4 (RTX 3090/4090). Qwen 3.8 27B è un po' più leggero (~18 GB in Q4) e lascia più margine per il contesto sulla stessa scheda.
i
Testarli entrambi richiede poco tempo
ollama pull qwen3.8:27b à côté de deepseek-r1:32b, puis comparez sur vos vrais prompts. Pensez à baisser le niveau de raisonnement de Qwen 3.8 en low si vous le trouvez trop bavard. C'est l'arbitrage le plus fiable — vos cas d'usage valent mieux que n'importe quel benchmark public.

#Risoluzione dei problemi

Modello che non mostra il <think>
Potresti stai usando un client che nasconde le etichette XML. Prova con ollama run en CLI per verificare che il modello le generi correttamente. Se l'API JSON le interrompe, è un problema del client.
Risposte troncate
Il contesto predefinito di Ollama è di 4096 token. R1 ne consuma molti per il ragionamento. Aumentalo: /set parameter num_ctx 16384 nella sessione, oppure tramite il parametro options.num_ctx nell'API.
Molto lento nonostante una buona GPU
Verifica con ollama ps che il modello sia ben 100 % GPU. Se la colonna PROCESSOR mostra del CPU, stai sforando in RAM. Scendi di una dimensione o passa a una quantizzazione più aggressiva.
Il modello entra in un ciclo ripetitivo nella sua catena di pensiero
È tipico dei piccoli modelli distillati (1.5B, 7B) alle prese con problemi troppo difficili. Passa a un modello più grande, oppure poni un problema più semplice, oppure aggiungi al tuo prompt «rispondi in meno di 500 token di ragionamento».
Errore "insufficient memory"
Modello troppo grande per la tua VRAM. ollama rm deepseek-r1:32b poi ollama pull deepseek-r1:14b. Puoi anche forzare un offload parziale con OLLAMA_GPU_LAYERS.

#Per approfondire

Alcune idee per proseguire dopo questa installazione:

Comprendere le quantizzazioni
La guida Q4/Q5/Q8 del sito illustra nel dettaglio i compromessi ed è utile prima di passare a un modello più grande.
Scegliere la propria GPU per R1
Se punti seriamente alla versione 32B, la guida all'acquisto delle GPU indica le soglie di 24/32 GB a cui puntare nel 2026.
Collegare R1 a un'interfaccia
Open WebUI o LM Studio gestiscono nativamente i tag <think> e permettono di comprimere ed espandere il ragionamento.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.