Home › Catalogo › Miglior LLM su RTX 5080 (16 GB) nel 2026

Miglior LLM su RTX 5080 (16 GB) nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 22/09/2026

La RTX 5080 (16 GB GDDR7, 960 GB/s) è il modello 2 Blackwell. VRAM identica alla 4080 ma GDDR7 + Neural Engine accelerato = 25-30% più veloce sui medesimi modelli.

Offerte e alternative per l'IA locale

Confronta i prezzi di RTX 5080 16 GB dai nostri rivenditori partner (schede prodotto verificate):

Un mini-PC è una macchina completa: controlla la memoria necessaria e la compatibilità del software. Non sostituisce macOS/MLX o CUDA.

Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →

Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.

Classifica

1

🇨🇳 Qwen 3 14B

Alibaba · 14 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.

Perché questa posizione Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.
ollama run qwen3:14b
Su RTX 5080
Q8
16 GB · 55 tok/s
2

🇺🇸 Phi-4 Reasoning 14B

Microsoft · 14 miliardi di parametri · MIT · 32 768 token ctx

Modello di ragionamento da 14B con licenza MIT. Supera R1-Distill-Llama-70B nelle valutazioni AIME24/25 di Microsoft con un quinto dei parametri.

Perché questa posizione Modello di ragionamento da 14B con licenza MIT. Supera R1-Distill-Llama-70B nelle valutazioni AIME24/25 di Microsoft con un quinto dei parametri.
ollama run phi4-reasoning:14b
Su RTX 5080
Q8
16 GB · 55 tok/s
3

🇺🇸 Phi-4 14B

Microsoft · 14 miliardi di parametri · MIT · 16 384 token ctx

Ragionamento eccezionale per le sue dimensioni. Orientato alle discipline STEM.

Perché questa posizione Ragionamento eccezionale per le sue dimensioni. Orientato alle discipline STEM.
ollama run phi4:14b
Su RTX 5080
Q8
16 GB · 55 tok/s
4

🇨🇳 Qwen 2.5 Coder 14B Instruct

Alibaba · 14 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Ottimo compromesso in termini di VRAM per la programmazione con modelli self-hosted.

Perché questa posizione Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Ottimo compromesso in termini di VRAM per la programmazione con modelli self-hosted.
ollama run qwen2.5-coder:14b
Su RTX 5080
Q8
16 GB · 55 tok/s
5

🇨🇳 DeepSeek R1 Distill Qwen 14B

DeepSeek · 14 miliardi di parametri · MIT · 131 072 token ctx

R1 distillato su Qwen 14B. AIME24 69.7, MATH-500 93.9. Supera o1-mini su molti benchmark.

Perché questa posizione R1 distillato su Qwen 14B. AIME24 69.7, MATH-500 93.9. Supera o1-mini su molti benchmark.
ollama run deepseek-r1:14b
Su RTX 5080
Q8
16 GB · 55 tok/s
6

🇨🇳 Qwen 2.5 14B Instruct

Alibaba · 14 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Denso 14B Apache 2.0. MMLU 79.7, HumanEval 83.5. 29+ lingue. Buon compromesso.

Perché questa posizione Denso 14B Apache 2.0. MMLU 79.7, HumanEval 83.5. 29+ lingue. Buon compromesso.
ollama run qwen2.5:14b
Su RTX 5080
Q8
16 GB · 55 tok/s
7

🇫🇷 Devstral Small 2 24B

Mistral AI · 24B parametri · Apache 2.0 · 256 000 token ctx

Specialista in programmazione 24B, Apache 2.0. 72.2% su SWE-Bench. 256k ctx, laboratorio francese.

Perché questa posizione Specialista in programmazione 24B, Apache 2.0. 72.2% su SWE-Bench. 256k ctx, laboratorio francese.
ollama run devstral-small2:24b
Su RTX 5080
Q4_K_M
14 GB · 40 tok/s

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Su RTX 5080
#1 Qwen 3 14B 14B 9 GB 131 072 Apache 2.0 55 tok/s · Q8
#2 Phi-4 Reasoning 14B 14B 9 GB 32 768 MIT 55 tok/s · Q8
#3 Phi-4 14B 14B 9 GB 16 384 MIT 55 tok/s · Q8
#4 Qwen 2.5 Coder 14B Instruct 14B 9 GB 131 072 Apache 2.0 55 tok/s · Q8
#5 DeepSeek R1 Distill Qwen 14B 14B 9 GB 131 072 MIT 55 tok/s · Q8
#6 Qwen 2.5 14B Instruct 14B 9 GB 131 072 Apache 2.0 55 tok/s · Q8
#7 Devstral Small 2 24B 24B 14 GB 256 000 Apache 2.0 40 tok/s · Q4_K_M
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Garanzia di rimborso di 30 giorni

Memo gratuito

Quale modello per la programmazione far girare sulla TUA macchina?

Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.

Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →

Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).

Metodologia della classifica

Filtro: modelli la cui versione Q4_K_M occupa meno di 14 GB. Bonus per i 7-14B (peak 5080) e per i 13-24B al limite. Larghezza di banda GDDR7 di 960 GB/s = ~30% di guadagno rispetto alla 4080.

Criteri presi in considerazione:

  • Q4_K_M ≤ 14 GB
  • 13-14B in Q5/Q6 fluido
  • Token/s ≥ 50 sui modelli 7B
  • Incremento di prestazioni con GDDR7 rispetto alla 4080

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

RTX 5080 vs RTX 4080 ?

Gli stessi 16 GB di VRAM. La 5080 è il 25-30% più veloce sugli stessi modelli grazie a GDDR7 (960 vs 736 GB/s) + Neural Engine Blackwell. Mistral Small 24B Q4: 5080 ~38 tok/s vs 4080 ~28 tok/s. Vedi RTX 4080.

È possibile far girare un modello da 30B su una 5080?

Mistral Small 24B Q4 (~13 GB): sì, a 35-40 tok/s. Qwen 3 32B Q3_K_M (~14 GB): al limite, con qualità ridotta. Per usare comodamente modelli da 30-32B in Q4, puntare su una RTX 5090 da 32 GB. Vedi RTX 5090.

Quale quantizzazione sulla 5080?

Q5_K_M per 7-9B (qualità massima, ~7 GB). Q4_K_M per 13-24B (Mistral Small 24B). Q6_K per 13-14B (Qwen 3 14B ~12 GB) ideale.

RTX 5080 o Mac Studio M4 Max 64 GB?

Studio M4 Max = silenzio + 64 GB (70B Q4 fluido). 5080 = velocità pura su 7-24B (35-50 tok/s). Se vuoi un 70B locale, Mac Studio. Per la velocità su 7-24B, RTX 5080. Vedi Mac Studio.

Confronti uno contro uno

Approfondisci con i nostri duelli dettagliati tra i finalisti:

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €