Home › Catalogo › Miglior LLM su RTX 2080 Ti (11 GB) nel 2026

Miglior LLM su RTX 2080 Ti (11 GB) nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 22/09/2026

La RTX 2080 Ti (11 GB GDDR6, 616 GB/s) rimane molto performante nel 2026 grazie ai suoi 11 GB. Qwen 3 14B Q4 (~8 GB) raggiunge 30+ tok/s, Mistral 7B Q8 (~7,5 GB) a 40+ tok/s.

Offerte e alternative per l'IA locale

RTX 2080 Ti : alternativa d'acquisto disponibile per l'IA locale — RTX 5060 Ti 16 GB :

Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →

Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.

Classifica

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.

Perché questa posizione Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Su RTX 2080 Ti
Q8
9 GB · 12 tok/s
2

🇺🇸 Gemma 4 12B

Google · 12B parametri · Apache 2.0 · 262 144 token ctx

Gemma 4 12B (Google): modello denso multimodale (testo, visione, audio), contesto da 256k, ~7 GB di VRAM in Q4. Apache 2.0, multilingue.

Perché questa posizione Gemma 4 12B (Google): modello denso multimodale (testo, visione, audio), contesto da 256k, ~7 GB di VRAM in Q4. Apache 2.0, multilingue.
# HuggingFace : google/gemma-4-12B
Su RTX 2080 Ti
Q5_K_M
9 GB · 18 tok/s
3

🇨🇳 Qwen 3 14B

Alibaba · 14 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.

Perché questa posizione Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.
ollama run qwen3:14b
Su RTX 2080 Ti
Q5_K_M
11 GB · 6 tok/s
4

🇺🇸 Granite 4.2 8B

IBM · 8 miliardi di parametri · Apache 2.0 · 128 000 token ctx

Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.

Perché questa posizione Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.
ollama pull granite4.2
Su RTX 2080 Ti
Q8
9 GB · 32 tok/s
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B parametri · Apache 2.0 · 16 000 token ctx

Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.

Perché questa posizione Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
Su RTX 2080 Ti
Q8
8 GB · 32 tok/s
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B parametri · MIT · 128 000 token ctx

GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.

Perché questa posizione GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.
ollama pull glm-5.3
Su RTX 2080 Ti
Q8
7 GB · 32 tok/s
7

🇨🇳 Qwen 3.5 9B

Alibaba · 9B parametri · Apache 2.0 · 262 000 token ctx

Modello denso 9B di nuova generazione. 262k ctx, ragionamento ibrido migliorato.

Perché questa posizione Modello denso 9B di nuova generazione. 262k ctx, ragionamento ibrido migliorato.
ollama run qwen3.5:9b
Su RTX 2080 Ti
Q8
10 GB · 9 tok/s

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Su RTX 2080 Ti
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q8
#2 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 18 tok/s · Q5_K_M
#3 Qwen 3 14B 14B 9 GB 131 072 Apache 2.0 6 tok/s · Q5_K_M
#4 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 32 tok/s · Q8
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 32 tok/s · Q8
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 tok/s · Q8
#7 Qwen 3.5 9B 9B 6 GB 262 000 Apache 2.0 9 tok/s · Q8
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Garanzia di rimborso di 30 giorni

Memo gratuito

Quale modello per la programmazione far girare sulla TUA macchina?

Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.

Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →

Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).

Metodologia della classifica

Filtro: Q4_K_M ≤ 10 GB. Bonus 7-14B. 616 GB/s = buona banda passante Turing.

Criteri presi in considerazione:

  • Q4_K_M ≤ 10 GB
  • Qwen 3 14B Q4 fluido
  • GDDR6 616 GB/s
  • Solida di seconda mano ~300 €

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

RTX 2080 Ti nel 2026: veramente utilizzabile?

Sì — 11 GB + 616 GB/s permettono 7-14B in Q4. Mistral 7B Q5 (~5,5 GB) a 50 tok/s, Qwen 3 14B Q4 (~8 GB) a 30-35 tok/s. Vedi guide.

2080 Ti vs 3060 12 GB ?

3060 12 GB = +1 GB di VRAM ma 360 GB/s contro i 616 GB/s della 2080 Ti. La 2080 Ti è circa il 70% più veloce. La 3060 è però più moderna (CUDA 11+, Ampere). Vedi 3060 12GB.

Prezzo di una 2080 Ti usata?

~300-400 € in Francia. Buon rapporto prestazioni/€ se si trova un'offerta. Una 3060 da 12 GB usata a ~200 € resta più adatta per il solo uso con LLM.

Conviene preferire una configurazione recente?

Per la velocità, sì (5070 ~650 € nuova). Per la quantità di VRAM, la 3090 usata (24 GB) resta imbattibile. La 2080 Ti è una solida scheda di fascia media storica. Vedi RTX 3090.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €