Quale LLM su RTX 4060 Ti (8 / 16 GB) ?
Su una RTX 4060 Ti, la versione da 16 GB è quella che conta per un LLM locale: carica Gemma 4 12B (da 7,7 a 8 GB), gpt-oss 20B (14 GB) o Mistral Small 24B (14 GB), che la versione da 8 GB non può contenere. Le due versioni condividono la stessa larghezza di banda di 288 GB/s, quindi offrono la stessa velocità con un modello che rientra nella memoria di entrambe. La versione da 8 GB si limita ai modelli con 9 miliardi di parametri o meno.
La RTX 4060 Ti esiste in due versioni vendute con lo stesso nome: 8 GB e 16 GB. Per un LLM locale, la differenza non è un dettaglio: distingue una scheda limitata ai piccoli modelli da una che può ospitare modelli da 12 a 24 miliardi di parametri. Questa guida spiega cosa può caricare ogni versione, il limite imposto dal suo bus di memoria e le schede da confrontare prima dell'acquisto.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RTX 4060 Ti per un LLM locale: 8 GB o 16 GB
Per un LLM locale, scegli la RTX 4060 Ti da 16 GB e lascia da parte quella da 8 GB. Le due versioni usano lo stesso chip, con 4 352 core CUDA secondo NVIDIA, e la stessa memoria a 288 GB/s: cambia solo la capacità. Questa capacità determina quali modelli si possono caricare. Con 8 GB si rimane su modelli da 4B a 9B, come Granite 4.2 8B o Qwen 3.5 9B. Con 16 GB, Gemma 4 12B trova spazio con un buon margine per il contesto, e gpt-oss 20B e Mistral Small 24B, ciascuno da 14 GB, entrano in VRAM con un margine ristretto. La velocità, invece, non cambia da una versione all'altra: è limitata dal bus da 128 bit. Il prezzo della versione da 16 GB usata va quindi confrontato con quello di una RTX 3060 da 12 GB o di una RTX 5060 Ti da 16 GB nuova.
- Architettura
- Ada Lovelace, 4.352 core CUDA nelle due versioni (pagina prodotto NVIDIA).
- Memoria
- 8 GB o 16 GB di GDDR6, bus da 128 bit, banda passante di 288 GB/s.
- Potenza
- 160 W nella versione da 8 GB e 165 W in quella da 16 GB secondo Wikipedia; NVIDIA indica un alimentatore da almeno 550 W per il PC.
- Prezzo di lancio
- 499 dollari per la versione da 16 GB, uscita a luglio 2023 (fonte: Wikipedia).
- Interfaccia
- PCIe 4.0 limitato a 8 linee, come la RTX 4060.
#8 GB o 16 GB: cosa carica ogni versione
| Modello | Dimensione | 4060 Ti 8 GB | 4060 Ti 16 GB |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | Sì | Sì, margine ampio |
| Qwen 3.5 9B | 6,6 GB | Sì, contesto breve | Sì |
| Gemma 4 12B | Da 7,7 a 8,0 GB | No | Sì, margine di 8 GB |
| gpt-oss 20B | 14 GB | No | Sì, margine di 2 GB |
| Mistral Small 24B | 14 GB | No | Sì, margine di 2 GB, contesto breve |
| Qwen 3.5 27B | 17 GB | No | No, supera i 16 GB |
La tabella si legge seguendo una sola regola: su 16 GB, riserva almeno 2 GB di margine per la cache di contesto e il sistema. Il margine è ampio con Gemma 4 12B, ridotto con gpt-oss 20B e Mistral Small 24B, impossibile da mantenere con un modello da 17 GB. Ollama utilizza per impostazione predefinita un contesto di 4.096 token; oltre questa soglia, la cache K/V consuma questo margine, da cui l'utilità di quantizzarla.
#Quale modello scegliere sulla versione 16 GB
- Gemma 4 12B
- La scelta versatile: pesi da 7,7 a 8,0 GB e un contesto di 256.000 token dichiarato nella libreria Ollama. Puoi estendere il contesto a 16.000 token o più senza superare la memoria disponibile.
- gpt-oss 20B
- Modello di ragionamento, 14 GB. Utilizzabile in VRAM con un contesto moderato. Consultare la guida dedicata per l'installazione.
- Mistral Small 24B
- 14 GB per un modello denso da 24 miliardi di parametri: legge più pesi per token, quindi è il più lento dei tre su una scheda a 288 GB/s.
- Qwen 3.5 9B
- 6,6 GB, il modello di fallback quando vuoi un contesto lungo o più modelli caricati.
#Installa e verifica che tutto sia in VRAM
Dopo ogni caricamento, ollama ps deve mostrare 100 % GPU. Una ripartizione tra CPU e GPU indica che parte del modello è stata trasferita nella RAM di sistema, il che rallenta fortemente la generazione su questa scheda, il cui collegamento PCIe è limitato a 8 linee. Sulla versione da 8 GB, provare gemma4:12b o gpt-oss:20b produce esattamente questa situazione.
#Quale velocità aspettarsi: limiti massimi e misurazioni di terzi
Nessuna velocità di generazione viene presentata qui come una misurazione effettuata da noi. Il limite teorico di generazione è la banda passante divisa per la dimensione dei pesi. Una misurazione pubblica di terzi (LLaMA 3 8B in Q4_K_M con llama.cpp, maggio 2024) rileva il 68% del limite su una RTX 4080 e il 75% su una RTX 4070 Ti, ossia un ordine di grandezza del 70%. Con una banda passante di 288 GB/s, si ottengono le seguenti stime, per un contesto breve.
| Modello | Dimensione del modello | Tetto | Stima al 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 54 token/s | circa 38 token/s |
| Qwen 3.5 9B | 6,6 GB | 44 token/s | circa 31 token/s |
| Gemma 4 12B | 7,7 GB | 37 token/s | circa 26 token/s |
| Mistral Small 24B | 14 GB | 21 token/s | circa 14 token/s |
Questi numeri seguono una logica inversa rispetto alla capacità: più il modello è grande, più incide il bus. Un modello con più esperti come gpt-oss 20B legge soltanto i suoi esperti attivi a ogni token, quindi il suo throughput reale supera quello di un modello denso delle stesse dimensioni; qui non viene riportato alcun valore misurato affidabile. Per una chat, 14 token/s consentono comunque una lettura agevole; per generare codice con output lunghi, questa velocità è insufficiente.
#Gestire il contesto su 16 GB
Il margine di 2 GB di gpt-oss 20B o di Mistral Small 24B si riduce con il contesto. Ollama può quantizzare la cache K/V in q8_0, utilizzando circa la metà della memoria rispetto al formato f16 predefinito; questo richiede che Flash Attention sia attiva. Su 16 GB, questa impostazione trasforma un modello da 14 GB con contesto breve in un modello utilizzabile con 8.000 token o più. Si configura all'avvio del server.
#4060 Ti 16 GB, 3060 12 GB o 5060 Ti 16 GB
| Scheda | VRAM | Larghezza di banda | Da ricordare |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 360 GB/s | Meno capacità, più veloce della 4060 Ti |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | La capacità per l'occasione, con un bus lento |
| RTX 5060 Ti 16 GB | 16 GB | 448 GB/s | Stessa capacità, 55 % di banda passante in più |
La scelta dipende da due criteri. Se il modello che vuoi usare pesa 14 GB, è adatta solo una scheda da 16 GB, e la 5060 Ti 16 GB legge la propria memoria il 55 % più velocemente della 4060 Ti, offrendo anche la garanzia di un prodotto nuovo. Se il modello che vuoi usare rientra in 12 GB, una RTX 3060 12 GB usata è generalmente più veloce e costa meno. La 4060 Ti 16 GB è la scelta giusta solo se il suo prezzo da usata è nettamente inferiore a quello di una 5060 Ti nuova: verificalo sulla pagina di monitoraggio dei prezzi.
#Ciò che non si riesce a caricare con 16 GB
Sedici gigabyte segnano un confine netto. I modelli da 14 GB ci stanno, quelli da 16 GB o più no, anche se quantizzati in Q4, perché occorre ancora spazio per il contesto. La tabella riporta le dimensioni pubblicate da Ollama per i modelli che si trovano appena al di sopra della soglia.
| Modello | Dimensione | Conseguenza su 16 GB |
|---|---|---|
| Qwen 3.5 27B | 17 GB | Eccede la VRAM: parte del modello passa in RAM |
| Gemma 4 26B | Da 16 a 19 GB | Supera la VRAM disponibile o non lascia spazio per il contesto |
| Qwen 3.5 35B | 24 GB | Fuori portata: prevedere 24 GB di VRAM |
Un modello che supera la capacità della VRAM continua a rispondere, ma una parte dei pesi viene letta dalla RAM di sistema attraverso un collegamento PCIe 4.0 limitato a 8 linee su questa scheda. La generazione diventa nettamente più lenta rispetto a un modello che entra interamente nella VRAM. Se questi modelli sono il tuo obiettivo, o se pensi di tenere la scheda per diversi anni mentre i modelli crescono, la scelta giusta è puntare su una scheda da 24 GB fin dall'acquisto, anziché ottimizzarne una da 16 GB.
La larghezza ridotta del bus non è l'unico criterio. L'elaborazione del prompt, cioè la lettura della tua domanda o dei tuoi documenti prima della prima risposta, sollecita soprattutto le risorse di calcolo, non la memoria. Su questo punto, la 4060 Ti beneficia dei suoi 4.352 core CUDA, contro i 3.072 della RTX 4060. Un documento lungo viene quindi letto relativamente in fretta (differenza non misurata qui), anche se la generazione successiva resta limitata dai 288 GB/s. Questa distinzione spiega perché una scheda possa sembrare reattiva alla prima parola e poi lenta durante la generazione continua.
#Acquistare o aspettare: tre domande da porsi
- Qual è il modello più grande che risulta utile?
- Se si tratta di un modello da 14B a 24B in Q4, la versione da 16 GB ha la capacità giusta. Se un modello da 8B a 9B basta, una scheda da 8 GB è già sufficiente e la versione da 16 GB rappresenta allora soltanto un costo aggiuntivo.
- Conta la velocità?
- Per una chat a uso personale, da 15 a 30 token/s sono sufficienti. Per gli agenti che generano in successione output lunghi, la banda passante di 288 GB/s diventa il fattore limitante e la 5060 Ti 16 GB si impone.
- Nuovo o usato?
- L'usato evita il prezzo del nuovo, ma non ha più garanzia; una scheda del 2023 potrebbe essere stata usata per il mining o per sessioni di gioco intensive. Controlla le temperature e il rumore delle ventole prima dell'acquisto.
#Verdetto 2026
- Prendi la versione da 16 GB se
- Il prezzo dell'usato è basso e punti a un modello da 12B a 24B. Accetti una velocità di elaborazione limitata dal bus.
- Evita la versione da 8 GB per l'LLM
- Non può caricare più di una RTX 4060 o di una RTX 5060, che hanno la stessa capacità.
- Preferisci la 5060 Ti 16 GB
- Se acquisti una scheda nuova, per la garanzia e la maggiore banda passante.
- Fonte: caratteristiche ufficiali NVIDIA (RTX 4060 Ti)
- Fonte: dimensioni di Gemma 4 nella libreria Ollama
- Fonte: FAQ ufficiale di Ollama (Flash Attention, cache K/V)
#Domande frequenti
RTX 4060 Ti 8 GB o 16 GB per un LLM?+
La RTX 4060 Ti 16 GB è lenta per un LLM?+
RTX 4060 Ti 16 GB o RTX 3060 12 GB?+
gpt-oss 20B entra nella memoria di una RTX 4060 Ti?+
Quale alimentatore per una RTX 4060 Ti?+
Come verificare che il modello rientri nella VRAM disponibile?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.