🇨🇳 Qwen 3 14B
Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.
ollama run qwen3:14b
Classifica aggiornata il 22/09/2026
La RTX 5060 Ti 16 GB (GDDR7, 448 GB/s) è la scheda di fascia bassa con 16 GB più economica. Il rapporto tra larghezza di banda e VRAM è basso, ma 16 GB permettono di eseguire modelli da 24B in Q4. Una buona scelta di base per gli LLM nel 2026.
Confronta i prezzi di RTX 5060 Ti 16 GB dai nostri rivenditori partner (schede prodotto verificate):
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.
ollama run qwen3:14b
Modello di ragionamento da 14B con licenza MIT. Supera R1-Distill-Llama-70B nelle valutazioni AIME24/25 di Microsoft con un quinto dei parametri.
ollama run phi4-reasoning:14b
Ragionamento eccezionale per le sue dimensioni. Orientato alle discipline STEM.
ollama run phi4:14b
Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Ottimo compromesso in termini di VRAM per la programmazione con modelli self-hosted.
ollama run qwen2.5-coder:14b
R1 distillato su Qwen 14B. AIME24 69.7, MATH-500 93.9. Supera o1-mini su molti benchmark.
ollama run deepseek-r1:14b
Denso 14B Apache 2.0. MMLU 79.7, HumanEval 83.5. 29+ lingue. Buon compromesso.
ollama run qwen2.5:14b
Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su RTX 5060 Ti 16GB |
|---|---|---|---|---|---|---|
| #1 | Qwen 3 14B | 14B | 9 GB | 131 072 | Apache 2.0 | 20 tok/s · Q8 |
| #2 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT | 20 tok/s · Q8 |
| #3 | Phi-4 14B | 14B | 9 GB | 16 384 | MIT | 20 tok/s · Q8 |
| #4 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 20 tok/s · Q8 |
| #5 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT | 20 tok/s · Q8 |
| #6 | Qwen 2.5 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 20 tok/s · Q8 |
| #7 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 35 tok/s · FP16 |
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: Q4_K_M ≤ 14 GB. Bonus 7-14B. La banda passante di 448 GB/s limita il throughput (~25-35 tok/s su 7B contro 60+ su 5070 Ti).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
RTX 5060 Ti 16 vs 4060 Ti 16 ?
5060 Ti GDDR7 448 GB/s vs 4060 Ti GDDR6 288 GB/s = ~50 % di aumento della banda passante. Mistral 7B Q4: 5060 Ti ~28 tok/s vs 4060 Ti ~20 tok/s. Vedi RTX 4060 Ti 16GB.
Perché 5060 Ti 16 e non 8?
Per i LLM, 16 GB consentono di utilizzare un'intera classe di modelli (24B Q4). Con 8 GB ci si limita ai modelli da 7-9B. Il costo aggiuntivo di circa 150 € è giustificato se l'uso principale riguarda i LLM. Vedi RTX 5060 per la versione da 8 GB.
5060 Ti 16 o 5070 ?
5070 = 12 GB ma 672 GB/s + 6144 core CUDA vs 4608. Più veloce sui modelli contenuti in 12 GB. 5060 Ti 16 = più VRAM (24B accessibile) ma rallenta sui grandi token. A seconda della priorità.
Budget 500 €: 5060 Ti 16 o Mac mini M4 24 GB?
Mac mini M4 = 24 GB di memoria unificata + silenziosità, ma 120 GB/s. 5060 Ti 16 = 16 GB + 448 GB/s. Per la velocità, 5060 Ti. Per un server silenzioso, Mac mini. Vedi Mac mini M4.
Approfondisci con i nostri duelli dettagliati tra i finalisti: