Quale LLM su RTX 5060 Ti (8 / 16 GB) ?
Una RTX 5060 Ti 16 GB mantiene in VRAM modelli fino a 14 miliardi di parametri (Qwen3 14B, 9,3 GB) e gpt-oss 20B (14 GB), a 41 token al secondo su un 14B secondo Hardware Corner. La versione 8 GB si limita ai modelli con 9 miliardi di parametri o meno. La banda passante di 448 GB/s è identica nelle due versioni; è la capacità a fare tutta la differenza.
La RTX 5060 Ti è disponibile nelle versioni da 8 GB e 16 GB, con la stessa GPU e la stessa larghezza di banda di 448 GB/s: solo la capacità determina cosa puoi eseguire. Questa guida indica, per ogni versione, i modelli che rientrano effettivamente nella memoria disponibile, le velocità misurate da Hardware Corner, l'effetto del contesto e il divario rispetto alle schede di fascia vicina. Saprai anche quando puntare a una scheda più veloce.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 5060 Ti per un LLM locale: cosa permettono 16 GB a 448 GB/s
Per un LLM locale, una RTX 5060 Ti da 16 GB mantiene interamente in VRAM i modelli fino a 14–20 miliardi di parametri, ma la sua larghezza di banda di 448 GB/s la rende da due a tre volte più lenta rispetto alle schede di fascia alta. Secondo la libreria Ollama, Qwen3 14B pesa 9,3 GB e gpt-oss 20B 14 GB. Hardware Corner misura 32,9 token al secondo su Qwen3 14B con 16.000 token di contesto e 43,8 su gpt-oss 20B con 128.000 token. I modelli da 27 a 32 miliardi, da 17 GB in su, non entrano in VRAM. La versione da 8 GB, invece, si limita ai modelli da 9 miliardi o meno.
- Memoria
- 16 GB o 8 GB di GDDR7 su un bus da 128 bit, secondo NVIDIA; 448 GB/s di banda, secondo Hardware Corner
- Consumo
- 180 W di potenza grafica e un alimentatore di sistema da 600 W richiesto, secondo NVIDIA. Quest'ultimo valore supera i 550 W spesso citati.
- Software
- Capacità di calcolo 12.0, supportata da Ollama con un driver 550 o più recente.
#8 GB o 16 GB: la sola vera domanda
Le due versioni condividono GPU e banda passante: cambia solo la capacità, e proprio questa determina cosa puoi avviare. NVIDIA propone la 5060 Ti da 16 GB e da 8 GB; il confronto qui sotto utilizza i file della libreria Ollama consultati il 29 settembre 2026.
| Modello | File Ollama | Versione 8 GB | Versione 16 GB |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | Ci sta, con un margine di 2,7 GB | Molto comodo |
| Qwen 3.5 9B | 6,6 GB | Ci sta, con un margine di 1,4 GB | Molto comodo |
| Gemma 4 12B | 7,6 GB | Margine di 0,4 GB: nessun contesto | Comodo |
| Qwen3 14B | 9,3 GB | Non entra | Margine di 6,7 GB |
| gpt-oss 20B | 14 GB | Non entra | Ci sta, con un margine di 2 GB |
| Devstral Small 2 24B | 15 GB | Non entra | Margine di solo 1 GB |
| Qwen 3.5 27B | 17 GB | Non entra | Non entra |
Con 8 GB, un modello da 9 miliardi lascia 1,4 GB per il contesto e il sistema: è poco, e si passa rapidamente all'offload nella RAM, più lento. La versione da 16 GB raddoppia il catalogo e permette di usare modelli da 12 a 20 miliardi. Per un uso regolare degli LLM, la versione da 16 GB è l'unica che mantiene un margine, anche se rimane lontana da una scheda da 24 GB.
#Calcolare il margine prima di scaricare un modello
La regola è semplice: la capacità della scheda meno le dimensioni del file dà il margine lordo, che deve coprire la cache KV, i buffer del motore e la memoria che il sistema operativo usa per la visualizzazione. Con Qwen3 14B, 16 - 9,3 lascia 6,7 GB; con Qwen 3.5 9B sulla versione da 8 GB, 8 - 6,6 lascia 1,4 GB. Più il margine è ridotto, più bisogna ridurre il contesto e quantizzare la cache. Se ollama ps mostra una ripartizione tra CPU e GPU, il modello o il suo contesto non entra interamente nella memoria della GPU e viene in parte trasferito nella RAM: la velocità di generazione scende allora a quella consentita dalla memoria RAM.
Sulla versione da 8 GB, tre abitudini evitano la maggior parte degli sforamenti della memoria disponibile. Scegli un modello da 9 miliardi di parametri o meno, il cui file resti sotto i 7 GB. Mantieni il contesto contenuto finché ollama ps mostra 100 % GPU. E chiudi le applicazioni che consumano memoria video, come il browser o i giochi, prima di avviare il modello.
#I modelli da preferire su 16 GB
La scelta giusta è partire da Qwen3 14B o da gpt-oss 20B. Qwen3 14B lascia quasi 7 GB per il contesto. gpt-oss 20B sta in 14 GB perché, secondo Ollama, i pesi dei suoi esperti sono quantizzati in MXFP4 a 4,25 bit per parametro, il che gli consente di girare su 16 GB di memoria. Un modello da 24 miliardi di parametri in Q4, come Devstral Small 2 (15 GB), lascia solo un GB: basta per uno scambio breve, non per un agente. Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, per un totale di 7,8 GB con Qwen 3.5 9B.
#Installa Ollama su una RTX 5060 Ti
- 01Verificare il driverEsegui nvidia-smi in un terminale: il driver deve essere in versione 550 o successiva (551.61 su Windows) e la memoria totale indicata deve essere di 16 GB, oppure di 8 GB per l'altra versione.
- 02Installare OllamaInstalla Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
- 03Avviare un modelloEsegui ollama run qwen3:14b su 16 GB, o ollama run qwen3.5:9b su 8 GB. Il download avviene una sola volta.
- 04Controllare la distribuzioneIn un secondo terminale, esegui ollama ps: la colonna Processore deve mostrare 100% GPU. Con 8 GB, una ripartizione CPU/GPU significa che il modello o il contesto supera la capacità della VRAM: scegli un modello più leggero.
- 05Regolare il contestoImposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se manca il margine, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio.
#Velocità misurate: la larghezza di banda determina il ritmo
I numeri provengono da Hardware Corner, che testa la versione da 16 GB con llama.cpp e contesti da 4k a 128k. Non sono misurazioni di QuelLLM.
| Modello (Q4_K, o MXFP4 per gpt-oss) | Contesto 4k | Contesto 32k | Contesto 128k | Lettura prompt 4k |
|---|---|---|---|---|
| Qwen3 8B | 69,2 | 38,9 | non misurato | 2 965,1 |
| Qwen3 14B | 41,1 | 25,9 | non misurato | 1 743,0 |
| gpt-oss 20B (MXFP4) | 92,1 | 73,2 | 43,8 | 3 585,2 |
La generazione è limitata dalla banda passante: il limite teorico equivale approssimativamente alla banda passante divisa per il peso del modello. Per Qwen3 14B (9,3 GB), 448 ÷ 9,3 dà 48 token al secondo, e il valore misurato a 4k, pari a 41,1, raggiunge l'85% di questo limite. Il contesto riduce la velocità: Qwen3 14B perde il 37% passando da 4k a 32k (da 41,1 a 25,9). gpt-oss 20B, modello a esperti, supera il suo limite apparente (448 ÷ 14 = 32) con 92,1 token al secondo, poiché legge solo una parte dei suoi pesi per token.
Ollama imposta il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token con meno di 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti e la ricerca web. La 5060 Ti rientra nella fascia da 4k. Secondo la sua FAQ, q8_0 riduce la memoria occupata dalla cache KV a circa la metà di quella richiesta da f16, con una perdita di precisione molto bassa: è la prima impostazione da attivare con 16 GB ed è indispensabile con 8 GB.
#5060 Ti rispetto alle altre schede: il divario misurato
| Scheda | Memoria | Generazione relativa |
|---|---|---|
| RTX 5070 Ti | 16 GB | 176 % |
| RTX 3090 | 24 GB | 158 % |
| RTX 4070 Super | 12 GB | 113 % |
| RTX 5060 Ti | 16 GB | 100 % |
| RTX 3060 | 12 GB | 69 % |
| RTX 4060 Ti | 16 GB | 68 % |
Questo grafico mostra il compromesso della 5060 Ti: genera quasi il doppio della velocità rispetto alla 4060 Ti 16 GB (100 ÷ 68), grazie alla sua memoria GDDR7 (448 contro 288 GB/s), ma resta lontana dalla 5070 Ti, che offre la stessa capacità con una velocità del 76% in più. Per la sola velocità di trasferimento, una 4070 Super da 12 GB è più veloce, ma non riesce a gpt-oss 20B. Secondo Hardware Corner, il suo rapporto prezzo/memoria la rende la « regina delle offerte » per i principianti nel 2026; confrontala con il monitoraggio dei prezzi attuali.
Hardware Corner osserva anche che due schede da 16 GB permettono di raggiungere 32 GB senza il costo di una scheda di punta. La ripartizione tra due GPU avviene tramite llama.cpp e la sua modalità tensor-split, descritta in dettaglio nella guida multi-GPU; aggiunge capacità, non velocità per scheda.
#Verdetto: 16 GB, 8 GB o un'altra scheda
| Situazione | Decisione | Motivazione supportata da dati numerici |
|---|---|---|
| Uso regolare di LLM, budget contenuto | 5060 Ti 16 GB | gpt-oss 20B a 128k di contesto: 43,8 t/s |
| Vuoi soprattutto un modello da 8 a 9 miliardi | La versione da 8 GB può essere sufficiente | Margine di 1,4 GB con Qwen 3.5 9B |
| Vuoi velocità a parità di capacità | 5070 Ti | 176 % della velocità della 5060 Ti |
| Vuoi un 27B denso | Scheda da 24 GB | Qwen 3.5 27B pesa 17 GB |
| Hai già una 4060 Ti 16 GB | Tenerla, a meno che non serva più velocità | 68 % della velocità della 5060 Ti |
Un metodo per decidere si riassume in due domande. Qual è il modello più grande che vuoi eseguire? Sotto i 9 miliardi, basta la versione da 8 GB; tra i 12 e i 20 miliardi, serve quella da 16 GB; oltre, serve una scheda da 24 GB o due schede. Quale velocità accetti? A 40 token al secondo su un 14B, la lettura rimane fluida; la 5070 Ti si giustifica solo se generi testi lunghi o servi più persone.
Per il fine-tuning, Unsloth indica i minimi di VRAM in QLoRA a 4 bit: 6 GB per un modello di 8 miliardi, 8,5 GB per 14 miliardi, 22 GB per 27 miliardi. La versione da 16 GB permette quindi di fine-tunare un modello da 14B con un batch di 1 e un contesto breve. Per i prezzi attuali, consulta il nostro monitoraggio, che segnala il prezzo più basso per ogni scheda due volte a settimana.
- Fonte: NVIDIA, specifiche della famiglia RTX 5060
- Fonte: Hardware Corner, benchmark LLM su RTX 5060 Ti 16 GB
- Fonte: Ollama, pagina del modello gpt-oss
- Fonte: documentazione di Ollama, lunghezza del contesto
- Fonte: Unsloth, VRAM richiesta per il fine-tuning
#Domande frequenti
RTX 5060 Ti 8 GB o 16 GB per un LLM locale?+
Quanti token al secondo su una RTX 5060 Ti?+
La RTX 5060 Ti 16 GB può eseguire un modello da 24 o 32 miliardi di parametri?+
Quale alimentatore per una RTX 5060 Ti?+
RTX 5060 Ti o RTX 4060 Ti 16 GB per gli LLM?+
È possibile fine-tunare un modello su una RTX 5060 Ti 16 GB?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.