Principiante 11 minRTX 40

Quale LLM su RTX 4060 (8 GB) ?

Risposta diretta

Una RTX 4060 (8 GB di GDDR6, 272 GB/s) fa girare senza difficoltà modelli da 3 a 9 miliardi di parametri in Q4: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB). Arranca non appena un modello e il suo contesto superano gli 8 GB. La sua banda passante impone un limite massimo teorico di circa 50 token/s su un 8B in Q4. Oltre questa soglia, sono i 12 o 16 GB a cambiare le possibilità d'uso, non la velocità della GPU.

La RTX 4060 è la scheda di fascia bassa della generazione Ada: 8 GB di VRAM, 115 W, un prezzo basso sul mercato dell'usato. Basta per avvicinarsi agli LLM locali, a condizione di conoscerne esattamente i limiti. Questa guida quantifica cosa entra nei suoi 8 GB, cosa consente la sua larghezza di banda, come configurare Ollama per non superare la memoria disponibile e quando conviene passare a una scheda da 12 o 16 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#La RTX 4060 per un LLM locale: cosa permette

Su una RTX 4060, un LLM locale funziona bene purché il modello, il suo contesto e il sistema rientrino negli 8 GB di VRAM. In Q4, questo copre i modelli da 3 a 9 miliardi di parametri: Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB e Qwen 3.5 9B 6,6 GB secondo il catalogo Ollama. Un 12B come Gemma 4 12B (da 7,7 a 8 GB) occupa già tutta la memoria della scheda prima ancora di considerare il contesto. La larghezza di banda di 272 GB/s determina la velocità: fissa un limite teorico di circa 51 token/s su un modello da 5,3 GB, mentre nella pratica la velocità resta inferiore. Per un assistente di chat, per riassumere testi o per un piccolo RAG, è sufficiente. Per lavorare sul codice di un repository di grandi dimensioni o per ragionamenti lunghi, non basta.

Architettura
Ada Lovelace, 3 072 core CUDA, Tensor Core di 4ª generazione, capacità di calcolo CUDA 8.9.
Memoria
8 GB di GDDR6 su un bus da 128 bit, ovvero 272 GB/s di banda (fonte: Wikipedia, tabella delle GeForce serie 40).
Consumo
Potenza grafica totale di 115 W; NVIDIA indica un'alimentazione minima di 550 W per l'intero PC.
Interfaccia
PCIe 4.0 limitato a 8 linee: un modello che viene caricato in parte nella RAM di sistema passa attraverso un collegamento a banda ridotta, penalizzando ulteriormente l'offload.
Disponibilità
Lanciata nel 2023, la scheda si trova soprattutto usata; i prezzi sono monitorati sulla pagina dedicata.
!
Perché la banda passante conta di più dei core
Durante la generazione, ogni token obbliga la GPU a rileggere la maggior parte dei pesi del modello. La velocità dipende quindi dal rapporto tra la larghezza di banda della memoria e la dimensione dei pesi, molto più che dal numero di core. Sotto questo aspetto, la 4060 è la più limitata della gamma Ada consumer: 272 GB/s, contro 672 GB/s per una 4070 Ti Super.

#Quali modelli stanno in 8 GB

Il riferimento del sito per Q4 è semplice: circa 0,6 GB per miliardo di parametri, considerando solo i pesi. Bisogna aggiungere la cache del contesto (KV cache) e un margine per la visualizzazione e il sistema. Ollama utilizza per impostazione predefinita un contesto di 4.096 token, che resta leggero; a 16.000 token la cache diventa una voce importante nell'occupazione della memoria. La tabella qui sotto riporta le dimensioni pubblicate da Ollama e indica il margine restante su 8 GB, prima di includere il contesto.

Modelli comuni su 8 GB di VRAM (dimensioni in Ollama, solo pesi)
ModelloDimensione in OllamaMargine su 8 GBVerdetto
Qwen 3.5 4B3,4 GB4,6 GBUtilizzo agevole, possibilità di un contesto lungo
Granite 4.2 8B5,3 GB2,7 GBUtilizzabile comodamente fino a circa 16.000 token con cache quantizzata
Qwen 3.5 9B6,6 GB1,4 GBMargine ridotto: contesto breve, applicazioni chiuse
Gemma 4 12BDa 7,7 a 8,0 GB0 GB o menoNon entra in memoria con un contesto utile
gpt-oss 20B14 GBNegativoFuori portata con la sola VRAM
Mistral Small 24B14 GBNegativoFuori portata con la sola VRAM

Due insidie ricorrono spesso. La prima: la dimensione di un file non corrisponde al fabbisogno di memoria, perché va aggiunta la memoria necessaria per il contesto. La seconda: un modello che supera la capacità della VRAM non va in crash, ma viene caricato in parte nella RAM di sistema e rallenta notevolmente. Il comando ollama ps mostra la ripartizione: una riga con il 100 % su GPU indica una situazione regolare, mentre una riga con una ripartizione CPU/GPU segnala che la capacità della VRAM è stata superata.

#Installare Ollama e avviare un primo modello

  1. 01
    Verificare il driver NVIDIA
    Ollama richiede un driver NVIDIA 550 o successivo per le schede con capacità di calcolo 5.0 o superiore. Una RTX 4060 (capacità 8.9) è esplicitamente elencata nella documentazione di Ollama. Controlla la versione con nvidia-smi.
  2. 02
    Installare Ollama
    Segui la guida di installazione per il tuo sistema. CUDA è incluso: non è necessario installare separatamente il toolkit.
  3. 03
    Avviare un modello adatto
    Inizia con ollama run granite4.2:8b (5,3 GB) o ollama run qwen3.5:9b (6,6 GB). Esegui poi ollama ps in un secondo terminale.
  4. 04
    Controllare il posizionamento
    La colonna PROCESSOR deve mostrare il 100 % GPU. Altrimenti, riduci il contesto o passa a un modello più piccolo.

#Quale velocità aspettarsi: il limite massimo, non la promessa

Qui non sono disponibili misurazioni effettuate da noi e nessun dato di velocità di generazione viene presentato come tale. È però possibile calcolare un limite massimo: la banda passante divisa per la dimensione dei pesi letti a ogni token. Una rilevazione di terzi pubblicata su GitHub (LLaMA 3 8B in Q4_K_M con llama.cpp, istantanea di maggio 2024) riporta rapporti tra velocità osservata e limite massimo del 68% su una RTX 4080 e del 75% su una RTX 4070 Ti. Un ordine di grandezza ragionevole: il 70% del limite massimo. Questi valori restano stime, valide per un contesto breve.

Limite teorico di generazione su RTX 4060 (272 GB/s)
Modello (Q4)Dimensione del modelloLimite teoricoStima al 70 %
Qwen 3.5 4B3,4 GB80 token/scirca 56 token/s
Granite 4.2 8B5,3 GB51 token/scirca 36 token/s
Qwen 3.5 9B6,6 GB41 token/scirca 29 token/s

Queste stime sono coerenti con l'uso di un assistente di chat: la lettura è agevole già a 15–20 token/s. Non tengono conto del contesto, che rallenta la generazione man mano che aumenta, né del tempo di elaborazione del prompt, che incide sul calcolo e non sulla memoria.

#Regolare Ollama per non superare gli 8 GB

Le impostazioni che contano sono quelle del contesto e della cache. Ollama quantizza la cache K/V in q8_0 per utilizzare circa la metà della memoria rispetto a f16, con una perdita di precisione molto bassa secondo la sua documentazione; questo richiede Flash Attention. Con 8 GB, è l'intervento più vantaggioso: permette di allungare il contesto senza cambiare modello.

Impostazioni del server Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Contesto ragionevole
Aumenta il contesto a 8.192 o 16.384 token solo se l'uso lo richiede: ogni raddoppio del contesto raddoppia la cache K/V.
Un solo modello caricato
Su 8 GB, tieni un solo modello in memoria; un modello di embedding per un RAG deve rimanere piccolo.
Liberare la VRAM
Il desktop, il browser e i giochi riservano VRAM. Chiudili prima del caricamento e controlla con nvidia-smi.
Quantizzazione
Resta in Q4_K_M: un modello 8B in Q8 (circa 8,5 GB) supera la capacità di memoria della scheda.

#Cosa la 4060 fa bene, fa male o non fa affatto

Il verdetto dipende dall'uso più che dalla scheda. Una breve chat o un riassunto di poche pagine resta entro limiti gestibili, sia con un 4B sia con un 8B. Un RAG richiede un modello di generazione, un modello di embedding e un contesto abbastanza lungo da contenere gli estratti recuperati: con 8 GB bisogna scegliere un modello di generazione da 4B a 8B e mantenere piccolo il modello di embedding. Un assistente di programmazione impone vincoli maggiori, perché i modelli specializzati e i loro contesti di diverse migliaia di token superano rapidamente la capacità della scheda.

Usi comuni su RTX 4060 (8 GB)
UsoRealistico?Impostazione consigliata
Chat quotidiana, domande breviSìGranite 4.2 8B o Qwen 3.5 4B, contesto predefinito
Riassunto di documenti da 10 a 20 pagineSì, con un contesto da 8.192 a 16.384Cache K/V in q8_0, Flash Attention abilitata
RAG sui tuoi fileSì, modello da 4B a 8BEmbedding leggeri, un solo modello di generazione caricato
Assistente di programmazione su un repositoryLimitatoModello da 4B a 8B, estratti brevi, nessun repository intero
Modello da 20B in su, tra cui gpt-oss 20BNoPrevedere almeno 16 GB di VRAM

Il caso di gpt-oss 20B illustra il limite: Ollama indica 14 GB per questo modello, e la sua scheda specifica che la quantizzazione MXFP4 permette di eseguirlo a partire da 16 GB di memoria. Una scheda da 8 GB non rientra nella configurazione prevista, qualunque sia la sua velocità di elaborazione.

#Quando passare a un'altra scheda

Tre segnali indicano che gli 8 GB diventano un limite. Vuoi un modello da 12B o più, incluso Gemma 4 12B. Lavori con documenti lunghi, dove il contesto supera i 16 000 token. Utilizzi un assistente di codice che carica un modello da 14 a 24 GB. In questi casi, aggiungere velocità non risolve nulla: manca la capacità di memoria, e la pagina dedicata agli 8 GB, ai 12 GB e ai 16 GB ti aiuta a individuare il livello giusto.

#4060, 3060 12 GB, 5060: un buon compromesso

Schede entry-level: capacità e larghezza di banda
SchedaVRAMLarghezza di bandaCosa cambia
RTX 3060 12 GB12 GB360 GB/sPiù VRAM: Gemma 4 12B ci sta, ma il bus è più vecchio
RTX 40608 GB272 GB/sConsumo basso, limite 8B-9B
RTX 50608 GB448 GB/sStessa capacità, limite di velocità superiore del 65 %

La RTX 3060 12 GB offre 4 GB di memoria in più e una maggiore larghezza di banda (360 GB/s secondo Wikipedia). Sul mercato dell’usato costa generalmente meno: consulta /prix-gpu-ia per la situazione del mercato. La RTX 5060 mantiene 8 GB, ma legge la memoria il 65 % più velocemente. Se per il tuo utilizzo bastano 8 GB, la 5060 è la più veloce; se ti servono più di 8 GB, la 3060 12 GB o la 4060 Ti 16 GB permettono di eseguire modelli che la 4060 non può caricare.

#Verdetto 2026

Tieni la tua 4060 se
Usi modelli da 3B a 9B, una chat o un RAG leggero. Nulla giustifica la sostituzione della scheda finché la memoria è sufficiente.
Non comprare una 4060 per gli LLM
Se l'uso principale è far girare un LLM, una scheda da 12 GB o più è più utile, anche a costo di privilegiare l'usato.
Passa a 16 GB
Se punti a modelli da 14B a 24B, per i quali 8 GB non saranno mai sufficienti.

#Domande frequenti

FAQ
La RTX 4060 può eseguire un LLM localmente?+
Sì, fino a circa 9 miliardi di parametri in Q4. Granite 4.2 8B (5,3 GB) e Qwen 3.5 9B (6,6 GB) rientrano nella VRAM, con un contesto breve per il secondo. Oltre gli 8 GB, Ollama trasferisce parte del modello nella RAM di sistema e la generazione rallenta notevolmente, rendendo i modelli da 12B in su poco pratici.
Quanti token al secondo su una RTX 4060?+
Nessuna misura affidabile è pubblicata qui. Il limite teorico, banda passante divisa per peso, è di circa 51 token/s per un modello da 5,3 GB, cioè quasi 36 token/s al 70% di questo limite. È una stima, non un risultato misurato, e diminuisce quando il contesto si allunga.
RTX 4060 o RTX 3060 12 GB per un LLM?+
Per i LLM, la 3060 da 12 GB è generalmente più interessante: 4 GB di memoria in più e una banda passante di 360 GB/s contro 272 GB/s. Carica Gemma 4 12B, che la 4060 non può ospitare. La 4060 mantiene il vantaggio sui consumi, 115 W, e nei giochi.
Quale alimentatore serve per una RTX 4060?+
NVIDIA indica 115 W di potenza grafica totale e una potenza minima consigliata dell'alimentatore di 550 W per l'intero PC. Questo valore include un margine per il processore e i picchi di consumo. Un alimentatore di qualità di questa potenza è sufficiente, poiché il LLM sollecita la scheda meno di alcuni giochi.
Come capire se il mio modello entra nella VRAM?+
Avvia il modello, poi esegui ollama ps in un secondo terminale: la colonna PROCESSOR mostra 100 % GPU se tutto è in VRAM, oppure una ripartizione CPU/GPU se una parte viene trasferita nella RAM di sistema. Monitora anche nvidia-smi durante una generazione lunga. Se una parte viene trasferita nella RAM di sistema, riduci il contesto o scegli un modello più piccolo.
È possibile sfruttare meglio gli 8 GB senza cambiare scheda?+
Tre interventi sono utili: abilitare Flash Attention e poi la cache K/V in q8_0, che riduce questa cache di circa la metà; limitare il contesto a quello che utilizzi; chiudere le applicazioni che occupano VRAM. Permettono di allungare il contesto, non di caricare un modello più grande.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.