Quale LLM su RTX 5060 (8 GB) ?
L'RTX 5060 associa 8 GB di GDDR7 a 448 GB/s, ovvero il 65 % in più di banda passante rispetto all'RTX 4060. È in grado di eseguire senza problemi modelli da 3 a 9 miliardi di parametri in Q4: Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB), con un limite teorico di circa 85 token/s su un 8B. Il suo limite è la capacità: un modello da 12B o più non entra in memoria con un contesto utile.
La RTX 5060 è la scheda da 8 GB più veloce sul mercato consumer per gli LLM locali, grazie alla sua memoria GDDR7. Ma 8 GB restano 8 GB. Questa guida quantifica quali modelli entrano in memoria e la velocità che puoi aspettarti, illustra le impostazioni di Ollama che evitano di superare la capacità disponibile e indica quando una RTX 5060 Ti 16 GB diventa un acquisto migliore.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RTX 5060 per un LLM locale: cosa permettono 8 GB di GDDR7
Una RTX 5060 esegue senza difficoltà i modelli da 3 a 9 miliardi di parametri in Q4. Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB secondo la libreria Ollama: tutti rientrano negli 8 GB della scheda, l'ultimo con un contesto breve. Un modello da 12B, come Gemma 4 12B (da 7,7 a 8 GB), occupa già tutta la memoria prima del primo token di contesto. Il punto di forza della scheda è la sua memoria: 448 GB/s su un bus da 128 bit, contro 272 GB/s per la RTX 4060, cioè il 65% in più. Per chat, riassunti o un piccolo RAG, la 5060 se la cava molto bene. Per superare i 9B, serve più VRAM, non più velocità.
- Architettura
- Blackwell, 3 840 core CUDA e Tensor Core di 5ª generazione secondo NVIDIA.
- Memoria
- 8 GB di GDDR7 su un bus da 128 bit, 448 GB/s di banda
- Potenza
- 145 W di potenza grafica totale; NVIDIA indica un alimentatore da almeno 550 W per l'intero PC.
- Prezzo di lancio
- 299 dollari, uscita il 19 maggio 2025 secondo Wikipedia.
#Perché la 5060 è più veloce della 4060 a parità di capacità
Durante la generazione, ogni token obbliga la GPU a rileggere la maggior parte dei pesi del modello. La velocità massima è quindi la larghezza di banda divisa per la dimensione dei pesi. La 5060 legge la propria memoria il 65% più velocemente della 4060: a parità di modello, il limite teorico aumenta nella stessa proporzione. È l'unico argomento tecnico che conta per l'LLM. I core CUDA aiutano nella lettura del prompt, non nella generazione, che resta limitata dalla memoria.
| Scheda | Memoria | Larghezza di banda | Limite massimo con un modello da 5,3 GB |
|---|---|---|---|
| RTX 4060 | 8 GB GDDR6 | 272 GB/s | 51 token/s |
| RTX 5060 | 8 GB GDDR7 | 448 GB/s | 85 token/s |
#Quali modelli stanno in 8 GB
| Modello | Dimensione | Margine su 8 GB | Verdetto |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Utilizzo agevole, possibilità di un contesto lungo |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Uso agevole, contesto moderato |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Margine ridotto, contesto breve |
| Gemma 4 12B | Da 7,7 a 8,0 GB | 0 GB o meno | Non entra in memoria con un contesto utile |
Gemma 4 12B illustra l'insidia delle dimensioni del file: i suoi pesi occupano da 7,7 a 8 GB, ma la scheda deve anche ospitare la cache del contesto e gestire la visualizzazione. Il modello si carica, ma con un contesto di qualche migliaio di token al massimo, e parte del modello viene trasferita nella RAM non appena un'applicazione occupa un po' di VRAM. Su una scheda da 8 GB, Qwen 3.5 9B o Granite 4.2 8B sono scelte più sicure e lasciano un margine utilizzabile.
#Immagini, visione e quantizzazione: due precisazioni
La libreria Ollama indica che Qwen 3.5 accetta testo e immagini: un modello da 4B o da 9B può quindi descrivere una schermata o leggere uno schema. Le immagini consumano contesto, riducendo il margine disponibile su 8 GB; preferisci il 4B (3,4 GB) per la visione se vuoi lasciare spazio libero. Quanto alla quantizzazione, Q4_K_M resta il giusto compromesso su 8 GB: passare a una quantizzazione più fine aumenta la dimensione dei pesi di diverse centinaia di megabyte, un margine che la scheda non ha, senza cambiamenti visibili nell'uso comune.
#Installare Ollama e verificare la scheda
- 01Driver NVIDIAOllama richiede un driver NVIDIA 550 o successivo. Per una RTX 50, installa il driver più recente offerto da NVIDIA. Controlla con nvidia-smi.
- 02Installare OllamaLa RTX 5060 figura nella lista delle schede supportate (capacità di calcolo 12.0). CUDA è integrato: non è necessaria alcuna installazione separata.
- 03Primo modelloAvvia ollama run qwen3.5:9b (6,6 GB) o ollama run granite4.2:8b (5,3 GB) se preferisci mantenere un margine.
- 04ControlloEsegui ollama ps: la colonna PROCESSOR deve mostrare 100% GPU.
#Quale velocità aspettarsi: un limite massimo, non una misurazione
Nessuna velocità di generazione è presentata qui come una misurazione effettuata da noi. Il limite massimo di generazione è la banda passante divisa per la dimensione dei pesi. Una misurazione pubblica di terzi (LLaMA 3 8B in Q4_K_M con llama.cpp, maggio 2024) rileva 106 token/s su una RTX 4080 il cui limite massimo è di 156 token/s, ossia circa il 68 %. Assumendo il 70 % come ordine di grandezza, si ottengono le seguenti stime per un contesto breve.
| Modello (Q4) | Dimensione del modello | Tetto | Stima al 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 token/s | circa 92 token/s |
| Granite 4.2 8B | 5,3 GB | 85 token/s | circa 59 token/s |
| Qwen 3.5 9B | 6,6 GB | 68 token/s | circa 48 token/s |
| Gemma 4 12B | 7,7 GB | 58 token/s | circa 40 token/s, contesto molto limitato |
Tutti questi limiti superano ampiamente la soglia per una lettura confortevole, intorno ai 15–20 token/s. A limitare la 5060 non sarà quindi la velocità, ma la capacità di 8 GB.
#Regolare Ollama per non superare gli 8 GB
Ollama quantizza la cache K/V in q8_0 per utilizzare circa la metà della memoria richiesta da f16, il formato predefinito, con una perdita di precisione molto ridotta secondo la sua documentazione; questo richiede Flash Attention. Con 8 GB, è l'intervento che offre il maggior beneficio: permette di estendere il contesto senza cambiare modello.
- Un solo modello
- Carica solo un modello alla volta; un modello di embedding per un RAG deve restare piccolo.
- Applicazioni che consumano molte risorse
- I browser con accelerazione hardware, i giochi e i programmi di codifica video riservano VRAM: chiudili prima di caricare.
- Contesto adatto
- Ogni raddoppio del contesto raddoppia la cache K/V: aumenta il contesto solo quando il compito lo richiede.
- Monitoraggio
- nvidia-smi durante una generazione lunga mostra il margine reale.
#Cosa si fa concretamente con 8 GB
Il criterio giusto è il lavoro richiesto, non la dimensione del modello. Una chat o una riformulazione si possono fare con un 4B come con un 8B. Un riassunto di documenti di qualche decina di pagine richiede un contesto da 8 000 a 16 000 token: con la cache K/V in q8_0, un 8B ci riesce con 8 GB. Un RAG combina un modello di generazione, un modello di embedding e il contesto degli estratti recuperati: mantieni il modello di generazione sotto i 9B. L'assistente di programmazione è il caso più impegnativo, perché i modelli specializzati superano presto la capacità della scheda.
| Uso | Realistico? | Impostazione consigliata |
|---|---|---|
| Chat quotidiana, domande brevi | Sì | Granite 4.2 8B, contesto predefinito |
| Riassunto di documenti da 10 a 30 pagine | Sì, con un contesto da 8.192 a 16.384 token | Cache K/V in q8_0, Flash Attention |
| RAG sui tuoi file | Sì, con un modello da 4B a 8B | Embedding leggeri, un solo modello di generazione |
| Assistente di programmazione su un repository | Limitato | Modello da 4B a 8B, estratti brevi |
| Modelli di 14 GB e oltre | No | Prevedere 16 GB di VRAM |
Se un modello supera la capacità della VRAM, la generazione non si interrompe: una parte dei pesi viene letta dalla RAM di sistema. Il sintomo è un brusco calo della velocità di generazione. Il comando ollama ps mostra la ripartizione tra GPU e CPU; una riga al 100% GPU indica un funzionamento regolare, mentre una riga con ripartizione tra GPU e CPU segnala che il modello non entra interamente nella VRAM. Per risolvere il problema, riduci il contesto o cambia modello.
#Quando la 5060 non basta più
Tre segnali indicano che serve più memoria. Vuoi un modello da 12B o più per una scrittura di qualità. Il tuo contesto supera regolarmente i 16 000 token a causa di documenti lunghi. Carichi contemporaneamente più modelli: per la generazione, gli embedding e il reranking. In questi casi, aumentare la velocità non cambia nulla: manca la capacità, e i livelli successivi sono descritti nelle pagine dedicate a 12 GB e 16 GB.
#5060 o 5060 Ti 16 GB: la scelta che conta
La RTX 5060 Ti 16 GB utilizza la stessa memoria GDDR7 su un bus da 128 bit, quindi la stessa banda passante di 448 GB/s secondo Wikipedia. I suoi 4.608 core CUDA e i 16 GB di memoria sono le sue vere differenze. Genera quindi alla stessa velocità con un modello che trova spazio nella memoria di entrambe le schede, ma carica anche modelli da 14 GB che la 5060 non può ospitare. I prezzi consigliati al lancio erano di 299 dollari per la 5060, 379 dollari per la 5060 Ti 8 GB e 429 dollari per la 5060 Ti 16 GB: con 130 dollari in più si ottiene una capacità doppia.
| Criterio | RTX 5060 | RTX 5060 Ti 16 GB |
|---|---|---|
| Memoria | 8 GB GDDR7 | 16 GB GDDR7 |
| Larghezza di banda | 448 GB/s | 448 GB/s |
| Core CUDA | 3 840 | 4 608 |
| Potenza grafica | 145 W | 180 W |
| Alimentazione minima | 550 W | 600 W |
| Modelli da 14 GB (gpt-oss 20B, Mistral Small 24B) | No | Sì, con 2 GB di margine |
#Verdetto 2026
- Compera una 5060 se
- I tuoi modelli sono da 4B a 9B, il budget è stretto e vuoi qualcosa di nuovo con garanzia. È la scheda da 8 GB più veloce.
- Preferisci la 5060 Ti 16 GB se
- Punti a modelli da 12B a 24B: la capacità conta più della velocità e il costo aggiuntivo è modesto.
- Evita la 5060 se
- Intendi usare Gemma 4 12B, gpt-oss 20B o qualsiasi modello da più di 8 GB per un uso serio.
Il riassunto sta in una frase: la 5060 è la scheda da 8 GB che si sceglie per la velocità e il prezzo, non per la capacità. Se il tuo utilizzo rientra negli 8 GB, è difficile da battere tra le schede nuove; se non ci rientra, nessuna regolazione compenserà gli 8 GB mancanti, e la scheda successiva della gamma è l'investimento giusto.
- Fonte: caratteristiche ufficiali NVIDIA (RTX 5060 e 5060 Ti)
- Fonte: GPU NVIDIA supportate da Ollama
- Fonte: FAQ ufficiale di Ollama (Flash Attention, cache K/V)
#Domande frequenti
La RTX 5060 può eseguire un LLM localmente?+
Quanti token al secondo su una RTX 5060?+
RTX 5060 o RTX 4060 Ti 16 GB per un LLM?+
Il FP4 della RTX 5060 accelera Ollama?+
Quale alimentatore serve per una RTX 5060?+
È possibile fare RAG con una RTX 5060?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.