Quale LLM su RTX 4060 (8 GB) ?
Una RTX 4060 (8 GB di GDDR6, 272 GB/s) fa girare senza difficoltà modelli da 3 a 9 miliardi di parametri in Q4: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB). Arranca non appena un modello e il suo contesto superano gli 8 GB. La sua banda passante impone un limite massimo teorico di circa 50 token/s su un 8B in Q4. Oltre questa soglia, sono i 12 o 16 GB a cambiare le possibilità d'uso, non la velocità della GPU.
La RTX 4060 è la scheda di fascia bassa della generazione Ada: 8 GB di VRAM, 115 W, un prezzo basso sul mercato dell'usato. Basta per avvicinarsi agli LLM locali, a condizione di conoscerne esattamente i limiti. Questa guida quantifica cosa entra nei suoi 8 GB, cosa consente la sua larghezza di banda, come configurare Ollama per non superare la memoria disponibile e quando conviene passare a una scheda da 12 o 16 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La RTX 4060 per un LLM locale: cosa permette
Su una RTX 4060, un LLM locale funziona bene purché il modello, il suo contesto e il sistema rientrino negli 8 GB di VRAM. In Q4, questo copre i modelli da 3 a 9 miliardi di parametri: Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB secondo il catalogo Ollama. Un 12B come Gemma 4 12B (da 7,7 a 8 GB) occupa già tutta la memoria della scheda prima ancora di considerare il contesto. La larghezza di banda di 272 GB/s determina la velocità: fissa un limite teorico di circa 51 token/s su un modello da 5,3 GB, mentre nella pratica la velocità resta inferiore. Per un assistente di chat, per riassumere testi o per un piccolo RAG, è sufficiente. Per lavorare sul codice di un repository di grandi dimensioni o per ragionamenti lunghi, non basta.
- Architettura
- Ada Lovelace, 3 072 core CUDA, Tensor Core di 4ª generazione, capacità di calcolo CUDA 8.9.
- Memoria
- 8 GB di GDDR6 su un bus da 128 bit, ovvero 272 GB/s di banda (fonte: Wikipedia, tabella delle GeForce serie 40).
- Consumo
- Potenza grafica totale di 115 W; NVIDIA indica un'alimentazione minima di 550 W per l'intero PC.
- Interfaccia
- PCIe 4.0 limitato a 8 linee: un modello che viene caricato in parte nella RAM di sistema passa attraverso un collegamento a banda ridotta, penalizzando ulteriormente l'offload.
- Disponibilità
- Lanciata nel 2023, la scheda si trova soprattutto usata; i prezzi sono monitorati sulla pagina dedicata.
#Quali modelli stanno in 8 GB
Il riferimento del sito per Q4 è semplice: circa 0,6 GB per miliardo di parametri, considerando solo i pesi. Bisogna aggiungere la cache del contesto (KV cache) e un margine per la visualizzazione e il sistema. Ollama utilizza per impostazione predefinita un contesto di 4.096 token, che resta leggero; a 16.000 token la cache diventa una voce importante nell'occupazione della memoria. La tabella qui sotto riporta le dimensioni pubblicate da Ollama e indica il margine restante su 8 GB, prima di includere il contesto.
| Modello | Dimensione in Ollama | Margine su 8 GB | Verdetto |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Utilizzo agevole, possibilità di un contesto lungo |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Utilizzabile comodamente fino a circa 16.000 token con cache quantizzata |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Margine ridotto: contesto breve, applicazioni chiuse |
| Gemma 4 12B | Da 7,7 a 8,0 GB | 0 GB o meno | Non entra in memoria con un contesto utile |
| gpt-oss 20B | 14 GB | Negativo | Fuori portata con la sola VRAM |
| Mistral Small 24B | 14 GB | Negativo | Fuori portata con la sola VRAM |
Due insidie ricorrono spesso. La prima: la dimensione di un file non corrisponde al fabbisogno di memoria, perché va aggiunta la memoria necessaria per il contesto. La seconda: un modello che supera la capacità della VRAM non va in crash, ma viene caricato in parte nella RAM di sistema e rallenta notevolmente. Il comando ollama ps mostra la ripartizione: una riga con il 100 % su GPU indica una situazione regolare, mentre una riga con una ripartizione CPU/GPU segnala che la capacità della VRAM è stata superata.
#Installare Ollama e avviare un primo modello
- 01Verificare il driver NVIDIAOllama richiede un driver NVIDIA 550 o successivo per le schede con capacità di calcolo 5.0 o superiore. Una RTX 4060 (capacità 8.9) è esplicitamente elencata nella documentazione di Ollama. Controlla la versione con nvidia-smi.
- 02Installare OllamaSegui la guida di installazione per il tuo sistema. CUDA è incluso: non è necessario installare separatamente il toolkit.
- 03Avviare un modello adattoInizia con ollama run granite4.2:8b (5,3 GB) o ollama run qwen3.5:9b (6,6 GB). Esegui poi ollama ps in un secondo terminale.
- 04Controllare il posizionamentoLa colonna PROCESSOR deve mostrare il 100 % GPU. Altrimenti, riduci il contesto o passa a un modello più piccolo.
#Quale velocità aspettarsi: il limite massimo, non la promessa
Qui non sono disponibili misurazioni effettuate da noi e nessun dato di velocità di generazione viene presentato come tale. È però possibile calcolare un limite massimo: la banda passante divisa per la dimensione dei pesi letti a ogni token. Una rilevazione di terzi pubblicata su GitHub (LLaMA 3 8B in Q4_K_M con llama.cpp, istantanea di maggio 2024) riporta rapporti tra velocità osservata e limite massimo del 68% su una RTX 4080 e del 75% su una RTX 4070 Ti. Un ordine di grandezza ragionevole: il 70% del limite massimo. Questi valori restano stime, valide per un contesto breve.
| Modello (Q4) | Dimensione del modello | Limite teorico | Stima al 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 80 token/s | circa 56 token/s |
| Granite 4.2 8B | 5,3 GB | 51 token/s | circa 36 token/s |
| Qwen 3.5 9B | 6,6 GB | 41 token/s | circa 29 token/s |
Queste stime sono coerenti con l'uso di un assistente di chat: la lettura è agevole già a 15–20 token/s. Non tengono conto del contesto, che rallenta la generazione man mano che aumenta, né del tempo di elaborazione del prompt, che incide sul calcolo e non sulla memoria.
#Regolare Ollama per non superare gli 8 GB
Le impostazioni che contano sono quelle del contesto e della cache. Ollama quantizza la cache K/V in q8_0 per utilizzare circa la metà della memoria rispetto a f16, con una perdita di precisione molto bassa secondo la sua documentazione; questo richiede Flash Attention. Con 8 GB, è l'intervento più vantaggioso: permette di allungare il contesto senza cambiare modello.
- Contesto ragionevole
- Aumenta il contesto a 8.192 o 16.384 token solo se l'uso lo richiede: ogni raddoppio del contesto raddoppia la cache K/V.
- Un solo modello caricato
- Su 8 GB, tieni un solo modello in memoria; un modello di embedding per un RAG deve rimanere piccolo.
- Liberare la VRAM
- Il desktop, il browser e i giochi riservano VRAM. Chiudili prima del caricamento e controlla con nvidia-smi.
- Quantizzazione
- Resta in Q4_K_M: un modello 8B in Q8 (circa 8,5 GB) supera la capacità di memoria della scheda.
#Cosa la 4060 fa bene, fa male o non fa affatto
Il verdetto dipende dall'uso più che dalla scheda. Una breve chat o un riassunto di poche pagine resta entro limiti gestibili, sia con un 4B sia con un 8B. Un RAG richiede un modello di generazione, un modello di embedding e un contesto abbastanza lungo da contenere gli estratti recuperati: con 8 GB bisogna scegliere un modello di generazione da 4B a 8B e mantenere piccolo il modello di embedding. Un assistente di programmazione impone vincoli maggiori, perché i modelli specializzati e i loro contesti di diverse migliaia di token superano rapidamente la capacità della scheda.
| Uso | Realistico? | Impostazione consigliata |
|---|---|---|
| Chat quotidiana, domande brevi | Sì | Granite 4.2 8B o Qwen 3.5 4B, contesto predefinito |
| Riassunto di documenti da 10 a 20 pagine | Sì, con un contesto da 8.192 a 16.384 | Cache K/V in q8_0, Flash Attention abilitata |
| RAG sui tuoi file | Sì, modello da 4B a 8B | Embedding leggeri, un solo modello di generazione caricato |
| Assistente di programmazione su un repository | Limitato | Modello da 4B a 8B, estratti brevi, nessun repository intero |
| Modello da 20B in su, tra cui gpt-oss 20B | No | Prevedere almeno 16 GB di VRAM |
Il caso di gpt-oss 20B illustra il limite: Ollama indica 14 GB per questo modello, e la sua scheda specifica che la quantizzazione MXFP4 permette di eseguirlo a partire da 16 GB di memoria. Una scheda da 8 GB non rientra nella configurazione prevista, qualunque sia la sua velocità di elaborazione.
#Quando passare a un'altra scheda
Tre segnali indicano che gli 8 GB diventano un limite. Vuoi un modello da 12B o più, incluso Gemma 4 12B. Lavori con documenti lunghi, dove il contesto supera i 16 000 token. Utilizzi un assistente di codice che carica un modello da 14 a 24 GB. In questi casi, aggiungere velocità non risolve nulla: manca la capacità di memoria, e la pagina dedicata agli 8 GB, ai 12 GB e ai 16 GB ti aiuta a individuare il livello giusto.
#4060, 3060 12 GB, 5060: un buon compromesso
| Scheda | VRAM | Larghezza di banda | Cosa cambia |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 360 GB/s | Più VRAM: Gemma 4 12B ci sta, ma il bus è più vecchio |
| RTX 4060 | 8 GB | 272 GB/s | Consumo basso, limite 8B-9B |
| RTX 5060 | 8 GB | 448 GB/s | Stessa capacità, limite di velocità superiore del 65 % |
La RTX 3060 12 GB offre 4 GB di memoria in più e una maggiore larghezza di banda (360 GB/s secondo Wikipedia). Sul mercato dell’usato costa generalmente meno: consulta /prix-gpu-ia per la situazione del mercato. La RTX 5060 mantiene 8 GB, ma legge la memoria il 65 % più velocemente. Se per il tuo utilizzo bastano 8 GB, la 5060 è la più veloce; se ti servono più di 8 GB, la 3060 12 GB o la 4060 Ti 16 GB permettono di eseguire modelli che la 4060 non può caricare.
#Verdetto 2026
- Tieni la tua 4060 se
- Usi modelli da 3B a 9B, una chat o un RAG leggero. Nulla giustifica la sostituzione della scheda finché la memoria è sufficiente.
- Non comprare una 4060 per gli LLM
- Se l'uso principale è far girare un LLM, una scheda da 12 GB o più è più utile, anche a costo di privilegiare l'usato.
- Passa a 16 GB
- Se punti a modelli da 14B a 24B, per i quali 8 GB non saranno mai sufficienti.
- Fonte: specifiche ufficiali NVIDIA (RTX 4060 e 4060 Ti)
- Fonte: FAQ ufficiale di Ollama (contesto, Flash Attention, cache K/V)
- Fonte: dimensioni dei modelli Qwen 3.5 nel catalogo di Ollama
#Domande frequenti
La RTX 4060 può eseguire un LLM localmente?+
Quanti token al secondo su una RTX 4060?+
RTX 4060 o RTX 3060 12 GB per un LLM?+
Quale alimentatore serve per una RTX 4060?+
Come capire se il mio modello entra nella VRAM?+
È possibile sfruttare meglio gli 8 GB senza cambiare scheda?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.