Quale LLM su RTX 5080 (16 GB) ?
Una RTX 5080 offre 16 GB di VRAM GDDR7 e 960 GB/s di banda passante: mantiene in VRAM modelli fino a 14 miliardi di parametri (Qwen3 14B, 9,3 GB) e gpt-oss 20B (14 GB), a 64 token al secondo su un 14B con 16k di contesto secondo Hardware Corner. Un 27B denso (17 GB) e un 70B non entrano in VRAM.
La RTX 5080 genera velocemente, ma con 16 GB condivide il limite di memoria delle schede meno costose. Questa guida elenca i modelli che entrano effettivamente in memoria, con il loro peso esatto, le velocità di generazione misurate da Hardware Corner, il budget di contesto e la differenza reale rispetto alla 5070 Ti, alla 4080 Super e alla 3090. Saprai anche quando passare a una scheda da 24 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: RTX 5080 16 GB.
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 5080 per un LLM locale: cosa permettono 16 GB
Per un LLM locale, il valore di una RTX 5080 sta nei suoi 16 GB di GDDR7 e nei suoi 960 GB/s di larghezza di banda: genera velocemente, ma la sua capacità limita i modelli. Secondo la libreria di Ollama, Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) entrano interamente nella VRAM, mentre Qwen 3.5 27B (17 GB) e Qwen3 30B (19 GB) superano la capacità della scheda. Hardware Corner misura 64 token al secondo su Qwen3 14B con 16.000 token di contesto e 105,6 su gpt-oss 20B con 128.000 token. È quindi molto adatta ai modelli da 8 a 20 miliardi di parametri, ma non a un 27B denso.
- Memoria
- 16 GB di GDDR7 su un bus da 256 bit, secondo NVIDIA; 960 GB/s di banda passante a 30 Gbit/s, secondo Hardware Corner.
- Calcolo
- 10 752 core CUDA e Tensor Cores di 5a generazione, secondo NVIDIA.
- Consumo
- 360 W di potenza grafica, un alimentatore di sistema da 850 W richiesto e una temperatura massima di 88 °C, secondo NVIDIA.
#I modelli che entrano in 16 GB
Le dimensioni indicate sono quelle dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è lo spazio che resta sui 16 GB prima di considerare il contesto, la cache e i buffer del motore.
| Modello | File Ollama | Margine lordo | Verdetto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Molto comodo |
| Qwen 3.5 9B | 6,6 GB | 9,4 GB | Uso molto agevole, testo e immagini |
| Gemma 4 12B | 7,6 GB | 8,4 GB | Comodo |
| Qwen3 14B | 9,3 GB | 6,7 GB | Utilizzo agevole, contesto di 32k possibile |
| gpt-oss 20B | 14 GB | 2 GB | Entra in memoria; è possibile usare un contesto lungo in MXFP4 |
| Devstral Small 2 24B / Mistral Small 3.2 24B | 15 GB | 1 GB | Margine troppo basso per un contesto utile |
| Qwen 3.5 27B | 17 GB | Manca 1 GB | Non entra |
| Qwen3 30B | 19 GB | Mancano 3 GB | Non entra |
Il modello da 14 miliardi in Q4 è il modello denso più grande che si può usare comodamente: lascia quasi 7 GB per il contesto. I modelli da 24 miliardi lasciano solo un GB e superano la capacità della VRAM non appena il contesto cresce: la scheda è adatta a un 24B finché la conversazione resta breve, non per un agente. Il caso di gpt-oss 20B è a parte: secondo Ollama, i pesi degli esperti sono quantizzati in MXFP4 a 4,25 bit per parametro, il che gli permette di funzionare con 16 GB di memoria, e Hardware Corner lo ha testato su questa scheda con un contesto fino a 128k.
Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, per un totale di 7,8 GB con Qwen 3.5 9B e 8,8 GB con Gemma 4 12B. Restano più di 7 GB per il contesto e la base di frammenti inseriti. Un agente di programmazione, invece, richiede un contesto di almeno 64.000 token secondo la documentazione di Ollama: con 16 GB, impone di scendere a un modello da 8 a 14 miliardi di parametri e di quantizzare la cache, anziché puntare a un 24B.
#Throughput misurato: velocità e limite della larghezza di banda
I numeri provengono da Hardware Corner, che effettua i test con llama.cpp su contesti da 4k a 128k. Non sono misure di QuelLLM.
| Modello (Q4_K, o MXFP4 per gpt-oss) | Contesto 4k | Contesto 32k | Contesto 128k | Lettura prompt 4k |
|---|---|---|---|---|
| Qwen3 8B | 129,1 | 72,5 | non misurato | 6 410,1 |
| Qwen3 14B | 80,6 | 51,9 | non misurato | 3 820,5 |
| gpt-oss 20B (MXFP4) | 172,4 | 149,3 | 105,6 | 9 146,1 |
La generazione è limitata dalla banda passante: il limite teorico corrisponde approssimativamente alla banda passante divisa per il peso del modello. Per Qwen3 14B (9,3 GB), 960 ÷ 9,3 dà 103 token al secondo e il valore misurato a 4k, pari a 80,6, raggiunge il 78% di questo limite. gpt-oss 20B supera il suo limite apparente (960 ÷ 14 = 69) con 172 token al secondo, perché un modello con esperti legge a ogni token solo una parte dei suoi pesi: il limite si calcola sui pesi attivi, non sul file intero.
Il contesto incide sulla velocità. Qwen3 14B passa da 80,6 a 51,9 token al secondo tra 4k e 32k (-36 %), mentre gpt-oss 20B perde solo il 13 % tra i medesimi limiti (172,4 a 149,3). Se lavori su documenti lunghi, la scelta del modello conta di più della scheda.
#Contesto e cache KV: il vero limite dei 16 GB
Ollama imposta il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token sotto i 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, la ricerca web e gli strumenti di programmazione. Una RTX 5080 ha quindi un contesto predefinito di 4k: un agente avviato con le impostazioni predefinite perde rapidamente la cronologia. Aumentare il contesto richiede VRAM sotto forma di cache KV, e questo consumo va sottratto al margine disponibile indicato nella tabella qui sopra.
La leva principale è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16, con una perdita di precisione molto bassa, e richiede Flash Attention, che Ollama attiva automaticamente quando la scheda e il modello la supportano. Su 16 GB, l'ordine di priorità è semplice: scegliere un modello che lasci almeno 5-6 GB di margine, poi quantizzare la cache, poi aumentare il contesto gradualmente controllando ollama ps.
#Installare Ollama su una RTX 5080
- 01Verificare il driverEsegui nvidia-smi in un terminale: il driver deve essere alla versione 550 o successiva (551.61 su Windows) e la memoria totale visualizzata deve essere di circa 16 GB.
- 02Installare OllamaInstalla Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
- 03Avviare un modelloEsegui ollama run qwen3:14b: il download di 9,3 GB avviene una volta. Per un modello più veloce, prova ollama run gpt-oss:20b (14 GB).
- 04Controllare la distribuzioneIn un secondo terminale, esegui ollama ps: la colonna Processore deve mostrare 100 % GPU. Una ripartizione CPU/GPU significa che il modello o il contesto supera la memoria disponibile sulla GPU.
- 05Regolare il contestoImposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se manca il margine, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio.
#Blackwell: MXFP4, NVFP4 e limite di potenza
La 5080 accelera a livello hardware i formati a virgola mobile a 4 bit: Hardware Corner indica che supporta MXFP4 e NVFP4, e il vantaggio si vede su gpt-oss 20B, i cui pesi sono forniti in MXFP4. NVIDIA descrive NVFP4 come un formato a virgola mobile a 4 bit introdotto con Blackwell. Il supporto di NVFP4 negli strumenti (llama.cpp, Ollama, vLLM) evolve rapidamente: verifica la versione installata e la scheda del modello, e mantieni Q4_K_M come scelta affidabile.
Flash Attention 3 è riservato a Hopper (H100) secondo il repository ufficiale di Flash Attention: su una 5080 si usa la versione 2 oppure l'implementazione di Ollama e llama.cpp, e Ollama la attiva automaticamente quando è disponibile. Per ridurre il consumo, nvidia-smi -pl imposta un limite di potenza in watt; poiché il LLM sollecita soprattutto la memoria, la perdita di velocità è modesta, ma misurala sul tuo modello.
#5080, 5070 Ti, 4080 Super, 3090: la differenza misurata
| Scheda | Memoria | Generazione relativa |
|---|---|---|
| RTX 4090 | 24 GB | 123 % |
| RTX 5080 | 16 GB | 100 % |
| RTX 5070 Ti | 16 GB | 91 % |
| RTX 3090 Ti | 24 GB | 89 % |
| RTX 4080 Super | 16 GB | 82 % |
| RTX 3090 | 24 GB | 81 % |
Questa tabella mostra tre cose. La 5070 Ti, anch'essa con 16 GB, raggiunge il 91% della velocità della 5080: in termini di puro throughput, il divario è ridotto. La 3090, all'81%, è quasi altrettanto veloce e dispone di 24 GB, il che cambia la gamma di modelli utilizzabili (Qwen 3.5 27B entra nella sua memoria, ma non in quella della 5080). Infine, la 4090 è più veloce del 23% e offre anch'essa 24 GB. Per un utilizzo esclusivamente con LLM, quindi, conta meno la velocità che la capacità.
#Verdetto: quando vale la pena scegliere la 5080
| Situazione | Decisione | Motivazione supportata da dati numerici |
|---|---|---|
| Modelli da 8 a 20 miliardi, uso rapido | 5080 adatta | 64 t/s su un 14B, 105,6 t/s su gpt-oss 20B a 128k |
| Vuoi un 27B denso | Scegliere una scheda da 24 GB | Qwen 3.5 27B pesa 17 GB, la 5080 ha 16 GB |
| Budget limitato per 16 GB | Confrontare 5070 Ti e 4080 Super | 91 % e 82 % della velocità della 5080 |
| Hai già una 4080 o 4080 Super | Tenerla | Stessa capacità di 16 GB |
| Hai già una 5070 Ti | Tenerla | 91 % della velocità della 5080, stessa capacità |
La 5080 è una buona scheda da 16 GB il cui difetto, per gli LLM, è non avere più memoria delle altre schede più economiche della stessa fascia. Prima di acquistare, poniti una sola domanda: qual è il modello denso più grande che vuoi eseguire? Fino a 14 miliardi di parametri, 16 GB bastano e la velocità della 5080 si fa sentire; oltre questa soglia, la capacità conta più della velocità, e una scheda usata da 24 GB permette di eseguire più modelli a una velocità simile. Per i prezzi del giorno, consulta il nostro monitoraggio, che rileva il prezzo più basso di ogni scheda due volte a settimana.
- Fonte: NVIDIA, specifiche della RTX 5080
- Fonte: Hardware Corner, benchmark LLM su RTX 5080
- Fonte: Ollama, pagina del modello gpt-oss
- Fonte: documentazione di Ollama, lunghezza del contesto
- Fonte: repository ufficiale di Flash Attention
#Domande frequenti
Quale LLM installare su una RTX 5080?+
La RTX 5080 può eseguire un modello 70B?+
RTX 5080 o RTX 5070 Ti per un LLM locale?+
16 GB sono sufficienti per un LLM nel 2026?+
Quale alimentatore per una RTX 5080?+
La RTX 5080 supporta FP4?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.