Quale LLM su RTX 3050 (6 / 8 GB) ?
Una RTX 3050 esegue senza difficoltà i piccoli modelli da 3 a 4 miliardi di parametri in Q4, come Granite 4.1 3B (2 GB) o Qwen 3.5 4B (2,3 GB). Un 8B in Q4 (Granite 4.2 8B, 4,6 GB) rientra nella memoria della versione da 8 GB ed è al limite su quella da 6 GB. La tabella pubblica di llama.cpp indica 37 token/s per la versione da 6 GB con un 7B in Q4_0.
La RTX 3050 esiste in due versioni desktop molto diverse: quella da 8 GB del 2022 e quella da 6 GB del 2024, che ha meno core, un bus più stretto e un consumo di 70 W. Questa guida distingue ciò che è misurato da ciò che è stimato, indica quali modelli rientrano nella memoria di ciascuna versione e spiega come ottenere il massimo da una scheda da 6 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5060 Ti 16 GB.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La RTX 3050 nel 2026: cosa riesce a eseguire
Una RTX 3050 esegue comodamente modelli da 3 a 4 miliardi di parametri in quantizzazione Q4. Secondo il catalogo QuelLLM, Granite 4.1 3B pesa 2 GB e Qwen 3.5 4B 2,3 GB: entrano sia nei 6 sia negli 8 GB, con spazio per il contesto. Un modello da 8 miliardi come Granite 4.2 8B (4,6 GB in Q4) entra nella versione da 8 GB ed è al limite su quella da 6 GB, che rende disponibili a llama.cpp solo 5.804 MiB. Un 9B come Qwen 3.5 9B (6 GB di pesi) non entra in nessuna delle due senza ricorrere anche alla RAM di sistema. Quanto alla velocità, l'unico risultato pubblico riguarda una versione da 6 GB: 37 token al secondo su un modello da 7 miliardi in Q4_0. È una velocità adeguata per conversare, ma la scheda raggiunge il proprio limite non appena il modello diventa più grande.
#RTX 3050 6 GB o 8 GB: due schede diverse
Con lo stesso nome, NVIDIA ha venduto due prodotti. I dati non possono essere mescolati: la 6 GB è più lenta a parità di memoria, perché il suo bus da 96 bit limita la banda passante a 168 GB/s, contro 224 GB/s per la 8 GB.
| Criterio | RTX 3050 8 GB | RTX 3050 6 GB |
|---|---|---|
| Core CUDA | 2 560 | 2 304 |
| Bus di memoria / banda passante | 128 bit / 224 GB/s | 96 bit / 168 GB/s |
| Potenza della scheda | 130 W | 70 W |
| Alimentatore di sistema consigliato da NVIDIA | 550 W | 300 W |
| Generazione su Llama 2 7B Q4_0 | Non pubblicata (stimata tra 45 e 50 tok/s) | 37,4 tok/s (misurazione pubblicata) |
Il valore stimato per la versione da 8 GB si ottiene applicando ai 224 GB/s il rapporto tra la misura e il limite teorico della versione da 6 GB, che raggiunge circa l'85% di quanto consentito dalla sua banda passante. È una proiezione, da non citare come risultato. Il consumo di 70 W rende la versione da 6 GB interessante per un vecchio PC con un'alimentazione limitata; del resto, la scheda tecnica NVIDIA non elenca alcun connettore di alimentazione aggiuntivo per questa versione.
#Modelli compatibili in base alla memoria
| Modello | Pesi in Q4 | RTX 3050 6 GB | RTX 3050 8 GB |
|---|---|---|---|
| Granite 4.1 3B | 2 GB | Con ampio margine | Con ampio margine |
| Qwen 3.5 4B | 2,3 GB (Q8: 4,3 GB) | Comodo in Q4, al limite in Q8 | Con ampio margine, Q8 possibile |
| Granite 4.2 8B | 4,6 GB | Limite: contesto molto breve | Discreto, contesto moderato |
| Qwen 3.5 9B | 6 GB | Non entra | Al limite, contesto breve |
La regola da tenere a mente è lasciare almeno un gigabyte libero per il contesto e il sistema. Sulla scheda da 6 GB, la memoria effettivamente disponibile per llama.cpp è di 5 804 MiB, cioè poco meno di 5,7 GB: un modello da 4,6 GB è quindi utilizzabile, ma il contesto dovrà rimanere breve. Sulla scheda da 8 GB, lo stesso modello lascia quasi tre gigabyte di margine. La guida sui 6 GB di VRAM descrive in dettaglio i modelli che vi funzionano senza difficoltà.
#Velocità: misure e stime
Nella tabella collaborativa di llama.cpp è stata aggiunta a luglio 2026 una misurazione su una RTX 3050 da 6 GB: 37,39 token al secondo in generazione con Llama 2 7B in Q4_0, un file da 3,56 GiB. Con Flash Attention, il valore sale a 38,51. Questo risultato va letto sotto due aspetti. Innanzitutto, raggiunge circa l'85% di quanto consente la banda passante di 168 GB/s, il che rappresenta una buona efficienza: la scheda è limitata dalla memoria, non dai core. Inoltre, la velocità di generazione diminuisce quando la generazione si prolunga: scende a 33,52 token al secondo su 2 048 token, ossia circa il 10% in meno.
Si può estrapolare ad altri modelli con una proporzione basata sulla dimensione del file. Si tratta di limiti superiori teorici, calcolati a partire dalla misurazione sulla versione da 6 GB, e non di risultati pubblicati.
| Modello | Pesi in Q4 | Velocità stimata |
|---|---|---|
| Granite 4.1 3B | 2 GB | circa 70 token/s |
| Qwen 3.5 4B | 2,3 GB | circa 60 token al secondo |
| Granite 4.2 8B | 4,6 GB | circa 30 token/s |
A titolo di confronto, la RTX 3060 12 GB genera 75,6 token al secondo nello stesso test: il doppio rispetto alla 3050 6 GB. Con un modello da 8 miliardi, la differenza si avverte nettamente, poiché, secondo la stima teorica, la 3050 6 GB scende a circa 30 token al secondo: il testo resta leggibile, ma viene generato più lentamente di quanto si legga.
#Suggerimenti per sfruttare 6 GB
- 01Scegliere un modello da 4 miliardi o menoQwen 3.5 4B o Granite 4.1 3B in Q4 lasciano da 3 a 4 GB di margine, consentendo un contesto sufficientemente ampio e un throughput nettamente superiore.
- 02Liberare la memoria videoChiudi il browser, i giochi e tutto ciò che usa la scheda: su 6 GB, ogni gigabyte occupato da un'altra applicazione riduce la memoria disponibile per il contesto.
- 03Quantizzare la cache K/VLa documentazione di Ollama specifica che la cache K/V può essere quantizzata quando Flash Attention è attivata. Imposta OLLAMA_FLASH_ATTENTION=1, poi OLLAMA_KV_CACHE_TYPE=q8_0 prima di avviare il server.
- 04Controllare il caricamentoDopo un primo prompt, esegui ollama ps: la colonna Processor deve mostrare 100% GPU. Altrimenti il modello non entra interamente nella VRAM e viene in parte trasferito nella RAM di sistema, e la velocità crolla.
#Identificare la versione che possiedi
Le due schede hanno lo stesso nome e gli annunci dell'usato non specificano sempre la memoria. Diversi indizi permettono di distinguerle senza aprire il PC. La scheda tecnica NVIDIA distingue la potenza delle due versioni: 130 W per quella da 8 GB, 70 W per quella da 6 GB, con un alimentatore di sistema consigliato rispettivamente da 550 W e 300 W. Una scheda senza connettore di alimentazione esterno è quindi molto probabilmente una versione da 6 GB, anche se alcuni modelli dei produttori possono includerne uno. Una volta installata la scheda, il comando nvidia-smi mostra la memoria totale: un valore vicino a 6 000 MiB indica la versione più piccola, e un valore vicino a 8 000 MiB quella più grande. Il test llama.cpp della versione da 6 GB ha inoltre rilevato 5 804 MiB utilizzabili, un po' meno della capacità nominale.
Questa verifica evita una confusione costosa: pagare una scheda da 8 GB e riceverne una da 6 GB cambia ciò che puoi eseguire, perché su quest'ultima Granite 4.2 8B diventa appena utilizzabile. Chiedi sempre uno screenshot di nvidia-smi prima dell'acquisto e rifiuta gli annunci che non specificano la memoria. Fai lo stesso per una scheda già installata in un PC recuperato: il nome mostrato da Windows non basta a distinguere le due versioni.
#Il contesto: fino a dove andare con 6 GB
La tabella di llama.cpp mostra che il throughput della 3050 6 GB diminuisce del 10% tra 128 e 2.048 token generati. Il secondo effetto riguarda la memoria: la cache di contesto consuma VRAM in proporzione alla lunghezza della conversazione. Su una scheda da 6 GB con un modello da 4 miliardi in Q4 (2,3 GB), rimangono oltre 3 GB per la cache, il che permette contesti di diverse migliaia di token senza difficoltà. Con un 8B da 4,6 GB, rimane solo circa un gigabyte: il contesto diventa il fattore limitante ben prima della velocità.
Due accorgimenti evitano brutte sorprese. Innanzitutto, limita di proposito la finestra di contesto a ciò che ti serve, anziché lasciare che un modello che dichiara centinaia di migliaia di token di contesto ne riservi una parte inutile. Poi, se lavori con documenti lunghi, suddividili: riassumere tre testi di duemila token richiede meno memoria che riassumerne uno solo di seimila. La guida sulla finestra di contesto illustra in dettaglio questi compromessi.
#A cosa serve davvero una RTX 3050 per l'IA locale
Con un modello da 3 a 4 miliardi di parametri in Q4, è sufficiente per compiti mirati: riassumere un testo, riformulare, classificare messaggi, rispondere a domande semplici su un documento breve o fornire il completamento automatico del codice. È poco adatta a conversazioni lunghe con un modello da 8B, al RAG su documenti voluminosi o a compiti di ragionamento che richiedono i modelli più capaci. Il limite non è solo la velocità: i modelli piccoli commettono più errori e perdono il filo più rapidamente. Prevedi quindi di verificare le loro risposte sui temi importanti e di non affidare loro decisioni dalle conseguenze rilevanti senza una revisione umana.
Se cerchi soprattutto di scoprire l'IA locale spendendo poco, la scheda svolge questo ruolo. Se vuoi un assistente quotidiano, un modello 8B su 8 GB di memoria è il minimo, e 12 GB offrono un margine che i prezzi dell'usato rendono spesso accessibile.
- Quale LLM su RTX 3060 12 GB?
- Prezzi delle schede grafiche per l'IA locale (aggiornamento settimanale)
#Verdetto 2026
- Uso limitato ai piccoli modelli
- Con 6 GB, resta a 4 miliardi di parametri o meno. Con 8 GB, un modello 8B in Q4 funziona con un contesto moderato.
- Preferisci una scheda da 12 GB
- La 3060 12 GB raddoppia il throughput misurato e permette di eseguire modelli da 12 miliardi di parametri. La differenza di prezzo sul mercato dell'usato varia ogni settimana: consulta il monitoraggio.
- All'acquisto
- Scegli la 3050 solo se è già nel tuo PC o se il budget è molto limitato. Verifica la versione, da 6 o 8 GB: gli annunci non la specificano sempre.
#Domande frequenti
La RTX 3050 può eseguire un LLM?+
RTX 3050 6 GB o 8 GB per l'IA locale?+
Quale modello scegliere su una RTX 3050 da 6 GB?+
Quanti token al secondo su una RTX 3050?+
RTX 3050 o RTX 3060 12 GB per un LLM?+
Ollama funziona su una RTX 3050?+
- Fonte: tabella delle prestazioni di llama.cpp su CUDA
- Fonte: scheda NVIDIA della RTX 3050
- Fonte: schede NVIDIA supportate da Ollama
- Fonte: FAQ Ollama (ollama ps, cache K/V)
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.