Principiante 11 minRTX 50

Quale LLM su RTX 5060 (8 GB) ?

Risposta diretta

L'RTX 5060 associa 8 GB di GDDR7 a 448 GB/s, ovvero il 65 % in più di banda passante rispetto all'RTX 4060. È in grado di eseguire senza problemi modelli da 3 a 9 miliardi di parametri in Q4: Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB), con un limite teorico di circa 85 token/s su un 8B. Il suo limite è la capacità: un modello da 12B o più non entra in memoria con un contesto utile.

La RTX 5060 è la scheda da 8 GB più veloce sul mercato consumer per gli LLM locali, grazie alla sua memoria GDDR7. Ma 8 GB restano 8 GB. Questa guida quantifica quali modelli entrano in memoria e la velocità che puoi aspettarti, illustra le impostazioni di Ollama che evitano di superare la capacità disponibile e indica quando una RTX 5060 Ti 16 GB diventa un acquisto migliore.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RTX 5060 per un LLM locale: cosa permettono 8 GB di GDDR7

Una RTX 5060 esegue senza difficoltà i modelli da 3 a 9 miliardi di parametri in Q4. Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB secondo la libreria Ollama: tutti rientrano negli 8 GB della scheda, l'ultimo con un contesto breve. Un modello da 12B, come Gemma 4 12B (da 7,7 a 8 GB), occupa già tutta la memoria prima del primo token di contesto. Il punto di forza della scheda è la sua memoria: 448 GB/s su un bus da 128 bit, contro 272 GB/s per la RTX 4060, cioè il 65% in più. Per chat, riassunti o un piccolo RAG, la 5060 se la cava molto bene. Per superare i 9B, serve più VRAM, non più velocità.

Architettura
Blackwell, 3 840 core CUDA e Tensor Core di 5ª generazione secondo NVIDIA.
Memoria
8 GB di GDDR7 su un bus da 128 bit, 448 GB/s di banda
Potenza
145 W di potenza grafica totale; NVIDIA indica un alimentatore da almeno 550 W per l'intero PC.
Prezzo di lancio
299 dollari, uscita il 19 maggio 2025 secondo Wikipedia.

#Perché la 5060 è più veloce della 4060 a parità di capacità

Durante la generazione, ogni token obbliga la GPU a rileggere la maggior parte dei pesi del modello. La velocità massima è quindi la larghezza di banda divisa per la dimensione dei pesi. La 5060 legge la propria memoria il 65% più velocemente della 4060: a parità di modello, il limite teorico aumenta nella stessa proporzione. È l'unico argomento tecnico che conta per l'LLM. I core CUDA aiutano nella lettura del prompt, non nella generazione, che resta limitata dalla memoria.

Schede da 8 GB: larghezza di banda e limite su un modello da 5,3 GB
SchedaMemoriaLarghezza di bandaLimite massimo con un modello da 5,3 GB
RTX 40608 GB GDDR6272 GB/s51 token/s
RTX 50608 GB GDDR7448 GB/s85 token/s

#Quali modelli stanno in 8 GB

Modelli su RTX 5060 (dimensioni indicate da Ollama, solo pesi)
ModelloDimensioneMargine su 8 GBVerdetto
Qwen 3.5 4B3,4 GB4,6 GBUtilizzo agevole, possibilità di un contesto lungo
Granite 4.2 8B5,3 GB2,7 GBUso agevole, contesto moderato
Qwen 3.5 9B6,6 GB1,4 GBMargine ridotto, contesto breve
Gemma 4 12BDa 7,7 a 8,0 GB0 GB o menoNon entra in memoria con un contesto utile

Gemma 4 12B illustra l'insidia delle dimensioni del file: i suoi pesi occupano da 7,7 a 8 GB, ma la scheda deve anche ospitare la cache del contesto e gestire la visualizzazione. Il modello si carica, ma con un contesto di qualche migliaio di token al massimo, e parte del modello viene trasferita nella RAM non appena un'applicazione occupa un po' di VRAM. Su una scheda da 8 GB, Qwen 3.5 9B o Granite 4.2 8B sono scelte più sicure e lasciano un margine utilizzabile.

#Immagini, visione e quantizzazione: due precisazioni

La libreria Ollama indica che Qwen 3.5 accetta testo e immagini: un modello da 4B o da 9B può quindi descrivere una schermata o leggere uno schema. Le immagini consumano contesto, riducendo il margine disponibile su 8 GB; preferisci il 4B (3,4 GB) per la visione se vuoi lasciare spazio libero. Quanto alla quantizzazione, Q4_K_M resta il giusto compromesso su 8 GB: passare a una quantizzazione più fine aumenta la dimensione dei pesi di diverse centinaia di megabyte, un margine che la scheda non ha, senza cambiamenti visibili nell'uso comune.

#Installare Ollama e verificare la scheda

  1. 01
    Driver NVIDIA
    Ollama richiede un driver NVIDIA 550 o successivo. Per una RTX 50, installa il driver più recente offerto da NVIDIA. Controlla con nvidia-smi.
  2. 02
    Installare Ollama
    La RTX 5060 figura nella lista delle schede supportate (capacità di calcolo 12.0). CUDA è integrato: non è necessaria alcuna installazione separata.
  3. 03
    Primo modello
    Avvia ollama run qwen3.5:9b (6,6 GB) o ollama run granite4.2:8b (5,3 GB) se preferisci mantenere un margine.
  4. 04
    Controllo
    Esegui ollama ps: la colonna PROCESSOR deve mostrare 100% GPU.

#Quale velocità aspettarsi: un limite massimo, non una misurazione

Nessuna velocità di generazione è presentata qui come una misurazione effettuata da noi. Il limite massimo di generazione è la banda passante divisa per la dimensione dei pesi. Una misurazione pubblica di terzi (LLaMA 3 8B in Q4_K_M con llama.cpp, maggio 2024) rileva 106 token/s su una RTX 4080 il cui limite massimo è di 156 token/s, ossia circa il 68 %. Assumendo il 70 % come ordine di grandezza, si ottengono le seguenti stime per un contesto breve.

Limite teorico su RTX 5060 (448 GB/s)
Modello (Q4)Dimensione del modelloTettoStima al 70 %
Qwen 3.5 4B3,4 GB132 token/scirca 92 token/s
Granite 4.2 8B5,3 GB85 token/scirca 59 token/s
Qwen 3.5 9B6,6 GB68 token/scirca 48 token/s
Gemma 4 12B7,7 GB58 token/scirca 40 token/s, contesto molto limitato

Tutti questi limiti superano ampiamente la soglia per una lettura confortevole, intorno ai 15–20 token/s. A limitare la 5060 non sarà quindi la velocità, ma la capacità di 8 GB.

#Regolare Ollama per non superare gli 8 GB

Ollama quantizza la cache K/V in q8_0 per utilizzare circa la metà della memoria richiesta da f16, il formato predefinito, con una perdita di precisione molto ridotta secondo la sua documentazione; questo richiede Flash Attention. Con 8 GB, è l'intervento che offre il maggior beneficio: permette di estendere il contesto senza cambiare modello.

Impostazioni del server Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Un solo modello
Carica solo un modello alla volta; un modello di embedding per un RAG deve restare piccolo.
Applicazioni che consumano molte risorse
I browser con accelerazione hardware, i giochi e i programmi di codifica video riservano VRAM: chiudili prima di caricare.
Contesto adatto
Ogni raddoppio del contesto raddoppia la cache K/V: aumenta il contesto solo quando il compito lo richiede.
Monitoraggio
nvidia-smi durante una generazione lunga mostra il margine reale.

#Cosa si fa concretamente con 8 GB

Il criterio giusto è il lavoro richiesto, non la dimensione del modello. Una chat o una riformulazione si possono fare con un 4B come con un 8B. Un riassunto di documenti di qualche decina di pagine richiede un contesto da 8 000 a 16 000 token: con la cache K/V in q8_0, un 8B ci riesce con 8 GB. Un RAG combina un modello di generazione, un modello di embedding e il contesto degli estratti recuperati: mantieni il modello di generazione sotto i 9B. L'assistente di programmazione è il caso più impegnativo, perché i modelli specializzati superano presto la capacità della scheda.

Uso su RTX 5060 (8 GB)
UsoRealistico?Impostazione consigliata
Chat quotidiana, domande breviSìGranite 4.2 8B, contesto predefinito
Riassunto di documenti da 10 a 30 pagineSì, con un contesto da 8.192 a 16.384 tokenCache K/V in q8_0, Flash Attention
RAG sui tuoi fileSì, con un modello da 4B a 8BEmbedding leggeri, un solo modello di generazione
Assistente di programmazione su un repositoryLimitatoModello da 4B a 8B, estratti brevi
Modelli di 14 GB e oltreNoPrevedere 16 GB di VRAM

Se un modello supera la capacità della VRAM, la generazione non si interrompe: una parte dei pesi viene letta dalla RAM di sistema. Il sintomo è un brusco calo della velocità di generazione. Il comando ollama ps mostra la ripartizione tra GPU e CPU; una riga al 100% GPU indica un funzionamento regolare, mentre una riga con ripartizione tra GPU e CPU segnala che il modello non entra interamente nella VRAM. Per risolvere il problema, riduci il contesto o cambia modello.

#Quando la 5060 non basta più

Tre segnali indicano che serve più memoria. Vuoi un modello da 12B o più per una scrittura di qualità. Il tuo contesto supera regolarmente i 16 000 token a causa di documenti lunghi. Carichi contemporaneamente più modelli: per la generazione, gli embedding e il reranking. In questi casi, aumentare la velocità non cambia nulla: manca la capacità, e i livelli successivi sono descritti nelle pagine dedicate a 12 GB e 16 GB.

#5060 o 5060 Ti 16 GB: la scelta che conta

La RTX 5060 Ti 16 GB utilizza la stessa memoria GDDR7 su un bus da 128 bit, quindi la stessa banda passante di 448 GB/s secondo Wikipedia. I suoi 4.608 core CUDA e i 16 GB di memoria sono le sue vere differenze. Genera quindi alla stessa velocità con un modello che trova spazio nella memoria di entrambe le schede, ma carica anche modelli da 14 GB che la 5060 non può ospitare. I prezzi consigliati al lancio erano di 299 dollari per la 5060, 379 dollari per la 5060 Ti 8 GB e 429 dollari per la 5060 Ti 16 GB: con 130 dollari in più si ottiene una capacità doppia.

RTX 5060 e RTX 5060 Ti: cosa cambia per gli LLM
CriterioRTX 5060RTX 5060 Ti 16 GB
Memoria8 GB GDDR716 GB GDDR7
Larghezza di banda448 GB/s448 GB/s
Core CUDA3 8404 608
Potenza grafica145 W180 W
Alimentazione minima550 W600 W
Modelli da 14 GB (gpt-oss 20B, Mistral Small 24B)NoSì, con 2 GB di margine

#Verdetto 2026

Compera una 5060 se
I tuoi modelli sono da 4B a 9B, il budget è stretto e vuoi qualcosa di nuovo con garanzia. È la scheda da 8 GB più veloce.
Preferisci la 5060 Ti 16 GB se
Punti a modelli da 12B a 24B: la capacità conta più della velocità e il costo aggiuntivo è modesto.
Evita la 5060 se
Intendi usare Gemma 4 12B, gpt-oss 20B o qualsiasi modello da più di 8 GB per un uso serio.

Il riassunto sta in una frase: la 5060 è la scheda da 8 GB che si sceglie per la velocità e il prezzo, non per la capacità. Se il tuo utilizzo rientra negli 8 GB, è difficile da battere tra le schede nuove; se non ci rientra, nessuna regolazione compenserà gli 8 GB mancanti, e la scheda successiva della gamma è l'investimento giusto.

#Domande frequenti

FAQ
La RTX 5060 può eseguire un LLM localmente?+
Sì, fino a circa 9 miliardi di parametri in Q4. Granite 4.2 8B (5,3 GB) e Qwen 3.5 9B (6,6 GB) rientrano nei suoi 8 GB di VRAM. Oltre questa soglia, come nel caso di Gemma 4 12B (da 7,7 a 8 GB), non rimane più spazio per il contesto e parte del modello viene caricata nella RAM di sistema.
Quanti token al secondo su una RTX 5060?+
Qui non è pubblicata alcuna misurazione affidabile. Il limite teorico, ottenuto dividendo la larghezza di banda di 448 GB/s per la dimensione del modello, è di circa 85 token/s per Granite 4.2 8B (5,3 GB), ossia quasi 59 token/s al 70% di questo limite. È una stima che diminuisce quando il contesto si allunga.
RTX 5060 o RTX 4060 Ti 16 GB per un LLM?+
Per i modelli che rientrano in 8 GB, la 5060 è più veloce: 448 GB/s contro 288 GB/s. Per i modelli da 14 GB, come gpt-oss 20B, solo la 4060 Ti 16 GB è adatta. La scelta dipende quindi dalle dimensioni del modello che vuoi usare, poi dal prezzo della 4060 Ti usata.
Il FP4 della RTX 5060 accelera Ollama?+
NVIDIA mette in evidenza il FP4 nei Tensor Cores di quinta generazione. I modelli comuni di Ollama, in Q4_K_M, non sono in formato FP4: qui non è documentato alcun vantaggio di questo tipo. Il fattore che accelera la generazione è la banda passante di 448 GB/s.
Quale alimentatore serve per una RTX 5060?+
NVIDIA indica 145 W di potenza grafica totale e un alimentatore da almeno 550 W per l'intero PC. Questo valore include il margine per il processore e i picchi di consumo. Un alimentatore di qualità da 550 W è adatto; la 5060 Ti richiede 600 W.
È possibile fare RAG con una RTX 5060?+
Sì, con un modello di generazione da 4B a 8B e un modello di embedding leggero. Mantieni caricato un solo modello di generazione, attiva la cache K/V in q8_0 e limita il contesto a quanto richiedono i tuoi estratti. Oltre questi limiti, la capacità di 8 GB diventa il fattore limitante.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.