Principiante 11 minRTX 50

Quale LLM su RTX 5060 Ti (8 / 16 GB) ?

Risposta diretta

Una RTX 5060 Ti 16 GB mantiene in VRAM modelli fino a 14 miliardi di parametri (Qwen3 14B, 9,3 GB) e gpt-oss 20B (14 GB), a 41 token al secondo su un 14B secondo Hardware Corner. La versione 8 GB si limita ai modelli con 9 miliardi di parametri o meno. La banda passante di 448 GB/s è identica nelle due versioni; è la capacità a fare tutta la differenza.

La RTX 5060 Ti è disponibile nelle versioni da 8 GB e 16 GB, con la stessa GPU e la stessa larghezza di banda di 448 GB/s: solo la capacità determina cosa puoi eseguire. Questa guida indica, per ogni versione, i modelli che rientrano effettivamente nella memoria disponibile, le velocità misurate da Hardware Corner, l'effetto del contesto e il divario rispetto alle schede di fascia vicina. Saprai anche quando puntare a una scheda più veloce.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 5060 Ti per un LLM locale: cosa permettono 16 GB a 448 GB/s

Per un LLM locale, una RTX 5060 Ti da 16 GB mantiene interamente in VRAM i modelli fino a 14–20 miliardi di parametri, ma la sua larghezza di banda di 448 GB/s la rende da due a tre volte più lenta rispetto alle schede di fascia alta. Secondo la libreria Ollama, Qwen3 14B pesa 9,3 GB e gpt-oss 20B 14 GB. Hardware Corner misura 32,9 token al secondo su Qwen3 14B con 16.000 token di contesto e 43,8 su gpt-oss 20B con 128.000 token. I modelli da 27 a 32 miliardi, da 17 GB in su, non entrano in VRAM. La versione da 8 GB, invece, si limita ai modelli da 9 miliardi o meno.

Memoria
16 GB o 8 GB di GDDR7 su un bus da 128 bit, secondo NVIDIA; 448 GB/s di banda, secondo Hardware Corner
Consumo
180 W di potenza grafica e un alimentatore di sistema da 600 W richiesto, secondo NVIDIA. Quest'ultimo valore supera i 550 W spesso citati.
Software
Capacità di calcolo 12.0, supportata da Ollama con un driver 550 o più recente.

#8 GB o 16 GB: la sola vera domanda

Le due versioni condividono GPU e banda passante: cambia solo la capacità, e proprio questa determina cosa puoi avviare. NVIDIA propone la 5060 Ti da 16 GB e da 8 GB; il confronto qui sotto utilizza i file della libreria Ollama consultati il 29 settembre 2026.

Cosa entra in memoria a seconda della versione (file Ollama, Q4 salvo diversa indicazione)
ModelloFile OllamaVersione 8 GBVersione 16 GB
Granite 4.2 8B5,3 GBCi sta, con un margine di 2,7 GBMolto comodo
Qwen 3.5 9B6,6 GBCi sta, con un margine di 1,4 GBMolto comodo
Gemma 4 12B7,6 GBMargine di 0,4 GB: nessun contestoComodo
Qwen3 14B9,3 GBNon entraMargine di 6,7 GB
gpt-oss 20B14 GBNon entraCi sta, con un margine di 2 GB
Devstral Small 2 24B15 GBNon entraMargine di solo 1 GB
Qwen 3.5 27B17 GBNon entraNon entra

Con 8 GB, un modello da 9 miliardi lascia 1,4 GB per il contesto e il sistema: è poco, e si passa rapidamente all'offload nella RAM, più lento. La versione da 16 GB raddoppia il catalogo e permette di usare modelli da 12 a 20 miliardi. Per un uso regolare degli LLM, la versione da 16 GB è l'unica che mantiene un margine, anche se rimane lontana da una scheda da 24 GB.

#Calcolare il margine prima di scaricare un modello

La regola è semplice: la capacità della scheda meno le dimensioni del file dà il margine lordo, che deve coprire la cache KV, i buffer del motore e la memoria che il sistema operativo usa per la visualizzazione. Con Qwen3 14B, 16 - 9,3 lascia 6,7 GB; con Qwen 3.5 9B sulla versione da 8 GB, 8 - 6,6 lascia 1,4 GB. Più il margine è ridotto, più bisogna ridurre il contesto e quantizzare la cache. Se ollama ps mostra una ripartizione tra CPU e GPU, il modello o il suo contesto non entra interamente nella memoria della GPU e viene in parte trasferito nella RAM: la velocità di generazione scende allora a quella consentita dalla memoria RAM.

Sulla versione da 8 GB, tre abitudini evitano la maggior parte degli sforamenti della memoria disponibile. Scegli un modello da 9 miliardi di parametri o meno, il cui file resti sotto i 7 GB. Mantieni il contesto contenuto finché ollama ps mostra 100 % GPU. E chiudi le applicazioni che consumano memoria video, come il browser o i giochi, prima di avviare il modello.

#I modelli da preferire su 16 GB

La scelta giusta è partire da Qwen3 14B o da gpt-oss 20B. Qwen3 14B lascia quasi 7 GB per il contesto. gpt-oss 20B sta in 14 GB perché, secondo Ollama, i pesi dei suoi esperti sono quantizzati in MXFP4 a 4,25 bit per parametro, il che gli consente di girare su 16 GB di memoria. Un modello da 24 miliardi di parametri in Q4, come Devstral Small 2 (15 GB), lascia solo un GB: basta per uno scambio breve, non per un agente. Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, per un totale di 7,8 GB con Qwen 3.5 9B.

#Installa Ollama su una RTX 5060 Ti

  1. 01
    Verificare il driver
    Esegui nvidia-smi in un terminale: il driver deve essere in versione 550 o successiva (551.61 su Windows) e la memoria totale indicata deve essere di 16 GB, oppure di 8 GB per l'altra versione.
  2. 02
    Installare Ollama
    Installa Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
  3. 03
    Avviare un modello
    Esegui ollama run qwen3:14b su 16 GB, o ollama run qwen3.5:9b su 8 GB. Il download avviene una sola volta.
  4. 04
    Controllare la distribuzione
    In un secondo terminale, esegui ollama ps: la colonna Processore deve mostrare 100% GPU. Con 8 GB, una ripartizione CPU/GPU significa che il modello o il contesto supera la capacità della VRAM: scegli un modello più leggero.
  5. 05
    Regolare il contesto
    Imposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se manca il margine, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio.
Comandi di base
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocità misurate: la larghezza di banda determina il ritmo

I numeri provengono da Hardware Corner, che testa la versione da 16 GB con llama.cpp e contesti da 4k a 128k. Non sono misurazioni di QuelLLM.

Generazione su RTX 5060 Ti 16 GB, token al secondo (Hardware Corner)
Modello (Q4_K, o MXFP4 per gpt-oss)Contesto 4kContesto 32kContesto 128kLettura prompt 4k
Qwen3 8B69,238,9non misurato2 965,1
Qwen3 14B41,125,9non misurato1 743,0
gpt-oss 20B (MXFP4)92,173,243,83 585,2

La generazione è limitata dalla banda passante: il limite teorico equivale approssimativamente alla banda passante divisa per il peso del modello. Per Qwen3 14B (9,3 GB), 448 ÷ 9,3 dà 48 token al secondo, e il valore misurato a 4k, pari a 41,1, raggiunge l'85% di questo limite. Il contesto riduce la velocità: Qwen3 14B perde il 37% passando da 4k a 32k (da 41,1 a 25,9). gpt-oss 20B, modello a esperti, supera il suo limite apparente (448 ÷ 14 = 32) con 92,1 token al secondo, poiché legge solo una parte dei suoi pesi per token.

Ollama imposta il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token con meno di 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti e la ricerca web. La 5060 Ti rientra nella fascia da 4k. Secondo la sua FAQ, q8_0 riduce la memoria occupata dalla cache KV a circa la metà di quella richiesta da f16, con una perdita di precisione molto bassa: è la prima impostazione da attivare con 16 GB ed è indispensabile con 8 GB.

#5060 Ti rispetto alle altre schede: il divario misurato

Generazione relativa per scheda (Hardware Corner, 5060 Ti 16 GB = 100 %)
SchedaMemoriaGenerazione relativa
RTX 5070 Ti16 GB176 %
RTX 309024 GB158 %
RTX 4070 Super12 GB113 %
RTX 5060 Ti16 GB100 %
RTX 306012 GB69 %
RTX 4060 Ti16 GB68 %

Questo grafico mostra il compromesso della 5060 Ti: genera quasi il doppio della velocità rispetto alla 4060 Ti 16 GB (100 ÷ 68), grazie alla sua memoria GDDR7 (448 contro 288 GB/s), ma resta lontana dalla 5070 Ti, che offre la stessa capacità con una velocità del 76% in più. Per la sola velocità di trasferimento, una 4070 Super da 12 GB è più veloce, ma non riesce a gpt-oss 20B. Secondo Hardware Corner, il suo rapporto prezzo/memoria la rende la « regina delle offerte » per i principianti nel 2026; confrontala con il monitoraggio dei prezzi attuali.

Hardware Corner osserva anche che due schede da 16 GB permettono di raggiungere 32 GB senza il costo di una scheda di punta. La ripartizione tra due GPU avviene tramite llama.cpp e la sua modalità tensor-split, descritta in dettaglio nella guida multi-GPU; aggiunge capacità, non velocità per scheda.

#Verdetto: 16 GB, 8 GB o un'altra scheda

Quale scelta fare in base alla tua situazione
SituazioneDecisioneMotivazione supportata da dati numerici
Uso regolare di LLM, budget contenuto5060 Ti 16 GBgpt-oss 20B a 128k di contesto: 43,8 t/s
Vuoi soprattutto un modello da 8 a 9 miliardiLa versione da 8 GB può essere sufficienteMargine di 1,4 GB con Qwen 3.5 9B
Vuoi velocità a parità di capacità5070 Ti176 % della velocità della 5060 Ti
Vuoi un 27B densoScheda da 24 GBQwen 3.5 27B pesa 17 GB
Hai già una 4060 Ti 16 GBTenerla, a meno che non serva più velocità68 % della velocità della 5060 Ti

Un metodo per decidere si riassume in due domande. Qual è il modello più grande che vuoi eseguire? Sotto i 9 miliardi, basta la versione da 8 GB; tra i 12 e i 20 miliardi, serve quella da 16 GB; oltre, serve una scheda da 24 GB o due schede. Quale velocità accetti? A 40 token al secondo su un 14B, la lettura rimane fluida; la 5070 Ti si giustifica solo se generi testi lunghi o servi più persone.

Per il fine-tuning, Unsloth indica i minimi di VRAM in QLoRA a 4 bit: 6 GB per un modello di 8 miliardi, 8,5 GB per 14 miliardi, 22 GB per 27 miliardi. La versione da 16 GB permette quindi di fine-tunare un modello da 14B con un batch di 1 e un contesto breve. Per i prezzi attuali, consulta il nostro monitoraggio, che segnala il prezzo più basso per ogni scheda due volte a settimana.

#Domande frequenti

FAQ
RTX 5060 Ti 8 GB o 16 GB per un LLM locale?+
Prendi la versione da 16 GB se vuoi eseguire qualcosa di diverso da un modello da 9 miliardi di parametri. La GPU e la larghezza di banda di 448 GB/s sono identiche, cambia solo la capacità. Con 8 GB, Qwen 3.5 9B (6,6 GB) lascia solo 1,4 GB di margine; con 16 GB, gpt-oss 20B (14 GB) e Qwen3 14B (9,3 GB) trovano spazio insieme al contesto.
Quanti token al secondo su una RTX 5060 Ti?+
Secondo Hardware Corner, la versione da 16 GB genera 41,1 token al secondo con Qwen3 14B a 4k di contesto, 69,2 con Qwen3 8B e 92,1 con gpt-oss 20B. Il contesto rallenta la generazione: Qwen3 14B scende a 25,9 token al secondo a 32k. Questi valori sono misurazioni effettuate da terzi.
La RTX 5060 Ti 16 GB può eseguire un modello da 24 o 32 miliardi di parametri?+
Un modello da 24B in Q4 (Devstral Small 2, 15 GB) entra a malapena in VRAM, con 1 GB di margine, quindi senza spazio per un contesto utile. Un modello da 27B o da 32B (da 17 a 20 GB) non ci entra. Hardware Corner indica che un modello da 30B entra solo con una quantizzazione a 3 bit, con un netto peggioramento della qualità.
Quale alimentatore per una RTX 5060 Ti?+
NVIDIA indica un alimentatore da 600 W come requisito per il sistema con una 5060 Ti, con 180 W di potenza grafica. Sono i valori del produttore per un PC completo. Un alimentatore da 550 W, spesso citato, è inferiore a questa raccomandazione, anche se può bastare per un PC a basso consumo.
RTX 5060 Ti o RTX 4060 Ti 16 GB per gli LLM?+
La 5060 Ti genera circa il 47% più velocemente, a parità di capacità di 16 GB: la 4060 Ti raggiunge il 68% del suo throughput secondo Hardware Corner, a causa di una banda passante di 288 GB/s contro 448. Confronta la differenza di prezzo prima di scegliere: con un budget ridotto, una 4060 Ti di seconda mano rimane utilizzabile.
È possibile fine-tunare un modello su una RTX 5060 Ti 16 GB?+
Sì, con QLoRA fino a 14 miliardi di parametri. Secondo Unsloth, il minimo assoluto è di 6 GB per un modello 8B e di 8,5 GB per un 14B, con un batch di 1 e un contesto breve. Un modello 27B richiede 22 GB e non entra in memoria. La versione da 8 GB è limitata a un modello 8B o 9B.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.