🇨🇳 DeepSeek R1 Distill 32B
Il miglior modello di ragionamento open-weight accessibile.
ollama run deepseek-r1:32b
Classifica aggiornata il 22/09/2026
Classifica dei modelli LLM specializzati in ragionamento: quelli che producono una catena di pensiero (chain-of-thought) esplicita prima della risposta. Eccellenti in matematica, logica formale, debug e domande scientifiche che richiedono più passaggi.
Il miglior modello di ragionamento open-weight accessibile.
ollama run deepseek-r1:32b
Modello di ragionamento RL con licenza Apache 2.0. AIME24 79.5, MATH-500 90.6. Concorrente diretto di DeepSeek R1.
ollama run qwq:32b
Modello di ragionamento da 14B con licenza MIT. Supera R1-Distill-Llama-70B nelle valutazioni AIME24/25 di Microsoft con un quinto dei parametri.
ollama run phi4-reasoning:14b
R1 distillato su Qwen 14B. AIME24 69.7, MATH-500 93.9. Supera o1-mini su molti benchmark.
ollama run deepseek-r1:14b
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza |
|---|---|---|---|---|---|
| #1 | DeepSeek R1 Distill 32B | 32B | 19 GB | 32 768 | MIT |
| #2 | QwQ 32B | 32B | 19 GB | 131 072 | Apache 2.0 |
| #3 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT |
| #4 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT |
| #5 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
Filtriamo per il tag «reasoning» — modelli esplicitamente addestrati a sviluppare una catena di pensiero (token
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Che cos'è un LLM di ragionamento?
Un modello che genera una catena di pensiero (una sequenza di passaggi interni) prima di produrre la risposta finale. È più lento e più verboso, ma molto più preciso sui problemi a più passaggi (matematica, logica, debug complesso).
DeepSeek R1 o QwQ-32B: quale è il migliore?
Vedi il confronto. I due sono molto simili, DeepSeek R1 è leggermente avanti su MATH, QwQ su GPQA. Scelta per licenza (entrambi MIT/Apache) e VRAM (stessa dimensione ~32B).
È possibile utilizzare questi modelli in tempo reale (chat) ?
Possibile ma sconsigliato: generano 2-5 volte più token di un modello normale (la catena di pensiero è visibile). Meglio riservarli alle domande che lo meritano e usare un modello veloce (Mistral 7B, Llama 3.1 8B) per la chat di base.
Quanta VRAM serve per DeepSeek R1 32B?
19 GB in Q4_K_M, 23 GB in Q5, 35 GB in Q8. Una RTX 4090 (24 GB) riesce a far girare il modello comodamente in Q5. Una RTX 3060 da 12 GB è fuori gioco per un modello di queste dimensioni.
Approfondisci con i nostri duelli dettagliati tra i finalisti: