Home › Catalogo › Miglior LLM su RTX 5060 (8 GB) nel 2026

Miglior LLM su RTX 5060 (8 GB) nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 22/09/2026

La RTX 5060 (8 GB GDDR7, 448 GB/s) è il modello entry-level Blackwell. 8 GB permettono solo i 7-9B in Q4_K_M, ma GDDR7 + Neural Engine offrono 35-45 tok/s su Mistral 7B.

Offerte e alternative per l'IA locale

RTX 5060 : alternativa d'acquisto disponibile per l'IA locale — RTX 5060 Ti 16 GB :

Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →

Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.

Classifica

1

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B parametri · Apache 2.0 · 16 000 token ctx

Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.

Perché questa posizione Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
Su RTX 5060
Q8
8 GB · 32 tok/s
2

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B parametri · MIT · 128 000 token ctx

GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.

Perché questa posizione GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.
ollama pull glm-5.3
Su RTX 5060
Q8
7 GB · 32 tok/s
3

🇺🇸 Granite 4.1 8B Instruct

IBM · 8 miliardi di parametri · Apache 2.0 · 131 072 token ctx

Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.

Perché questa posizione Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Su RTX 5060
Q5_K_M
6 GB · 12 tok/s
4

🇺🇸 OLMo 3 7B

Allen AI · 7B parametri · Apache 2.0 · 8 192 token ctx

Modello denso 7B aperto al 100% (pesi + dati + codice). Trasparenza totale per la ricerca.

Perché questa posizione Modello denso 7B aperto al 100% (pesi + dati + codice). Trasparenza totale per la ricerca.
ollama run olmo-3:7b
Su RTX 5060
Q5_K_M
6 GB · 12 tok/s
5

🇺🇸 LFM2.5 7B

Liquid AI · 7B parametri · LFM Open License v1.0 · 32 768 token ctx

LFM2.5 7B (Liquid AI): Liquid Foundation Model denso, contesto da 32k, 4.1 GB di VRAM in Q4. Ottimizzato per CPU ed edge. Uscita a maggio 2026.

Perché questa posizione LFM2.5 7B (Liquid AI): Liquid Foundation Model denso, contesto da 32k, 4.1 GB di VRAM in Q4. Ottimizzato per CPU ed edge. Uscita a maggio 2026.
ollama pull lfm2.5
Su RTX 5060
Q8
7 GB · 32 tok/s
6

🇺🇸 Granite 4.2 8B

IBM · 8 miliardi di parametri · Apache 2.0 · 128 000 token ctx

Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.

Perché questa posizione Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.
ollama pull granite4.2
Su RTX 5060
Q5_K_M
6 GB · 32 tok/s
7

🇺🇸 LFM2.5 DSpark

Liquid AI · 7B parametri · LFM Open License v1.0 · 32 768 token ctx

LFM2.5 DSpark (Liquid AI): Liquid Foundation Model denso 7B, contesto da 32k, ~4,1 GB di VRAM in Q4. Chat versatile ottimizzata per edge/CPU.

Perché questa posizione LFM2.5 DSpark (Liquid AI): Liquid Foundation Model denso 7B, contesto da 32k, ~4,1 GB di VRAM in Q4. Chat versatile ottimizzata per edge/CPU.
# HuggingFace : LiquidAI/LFM2.5-DSpark
Su RTX 5060
Q8
7 GB · 32 tok/s

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza Su RTX 5060
#1 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 32 tok/s · Q8
#2 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 tok/s · Q8
#3 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#4 OLMo 3 7B 7B 5 GB 8 192 Apache 2.0 12 tok/s · Q5_K_M
#5 LFM2.5 7B 7B 4.1 GB 32 768 LFM Open License v1.0 32 tok/s · Q8
#6 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 32 tok/s · Q5_K_M
#7 LFM2.5 DSpark 7B 4.1 GB 32 768 LFM Open License v1.0 32 tok/s · Q8
Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Garanzia di rimborso di 30 giorni

Memo gratuito

Quale modello per la programmazione far girare sulla TUA macchina?

Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.

Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →

Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).

Metodologia della classifica

Filtro: Q4_K_M ≤ 7 GB (lascia 1 GB per il contesto). Bonus per i modelli da 3-9B (picco di 8 GB) e ≤ 7B (senza swap). 448 GB/s = throughput discreto per la fascia entry-level.

Criteri presi in considerazione:

  • Q4_K_M ≤ 7 GB
  • Mistral 7B Q4 fluido
  • Tokens/sec ≥ 35 su 7B
  • Incremento di prestazioni grazie alla GDDR7 rispetto alla 4060

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

RTX 5060 vs RTX 4060 ?

Sempre 8 GB. 5060 GDDR7 448 GB/s vs 4060 GDDR6 272 GB/s = ~65% di aumento. Mistral 7B Q4: 5060 ~40 tok/s vs 4060 ~24 tok/s. Vedi RTX 4060.

8 GB bastano per iniziare a usare gli LLM in locale?

Sì — Mistral 7B Q4 (~4,5 GB), Qwen 3 8B Q4 (~5 GB), Llama 3.2 3B Q4 (~2 GB) sono tutti eccellenti. Per i modelli da 13B in su, servono 12 GB (RTX 5070). Vedi classifica 8 GB VRAM.

RTX 5060 o 5060 Ti 16 ?

5060 = fascia base, 8 GB (~340 €). 5060 Ti 16 = fascia media, 16 GB (~480 €). Spendere 150 € in più permette di eseguire i modelli da 24B (Mistral Small Q4). Se il budget lo permette, 5060 Ti 16. Vedi RTX 5060 Ti 16GB.

Quale quantizzazione sulla 5060?

Q5_K_M per 7B (5,5 GB, qualità massima). Q4_K_M per 8-9B (5-5,5 GB). Q4_0 se vuoi farci stare a tutti i costi un 13B (~7 GB), ma con una qualità inferiore. Resta su un 7B in Q5 per il miglior compromesso.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €