Intermedio 11 minRTX 50

Quale LLM su RTX 5080 (16 GB) ?

Risposta diretta

Una RTX 5080 offre 16 GB di VRAM GDDR7 e 960 GB/s di banda passante: mantiene in VRAM modelli fino a 14 miliardi di parametri (Qwen3 14B, 9,3 GB) e gpt-oss 20B (14 GB), a 64 token al secondo su un 14B con 16k di contesto secondo Hardware Corner. Un 27B denso (17 GB) e un 70B non entrano in VRAM.

La RTX 5080 genera velocemente, ma con 16 GB condivide il limite di memoria delle schede meno costose. Questa guida elenca i modelli che entrano effettivamente in memoria, con il loro peso esatto, le velocità di generazione misurate da Hardware Corner, il budget di contesto e la differenza reale rispetto alla 5070 Ti, alla 4080 Super e alla 3090. Saprai anche quando passare a una scheda da 24 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: RTX 5080 16 GB.

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 5080 per un LLM locale: cosa permettono 16 GB

Per un LLM locale, il valore di una RTX 5080 sta nei suoi 16 GB di GDDR7 e nei suoi 960 GB/s di larghezza di banda: genera velocemente, ma la sua capacità limita i modelli. Secondo la libreria di Ollama, Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) entrano interamente nella VRAM, mentre Qwen 3.5 27B (17 GB) e Qwen3 30B (19 GB) superano la capacità della scheda. Hardware Corner misura 64 token al secondo su Qwen3 14B con 16.000 token di contesto e 105,6 su gpt-oss 20B con 128.000 token. È quindi molto adatta ai modelli da 8 a 20 miliardi di parametri, ma non a un 27B denso.

Memoria
16 GB di GDDR7 su un bus da 256 bit, secondo NVIDIA; 960 GB/s di banda passante a 30 Gbit/s, secondo Hardware Corner.
Calcolo
10 752 core CUDA e Tensor Cores di 5a generazione, secondo NVIDIA.
Consumo
360 W di potenza grafica, un alimentatore di sistema da 850 W richiesto e una temperatura massima di 88 °C, secondo NVIDIA.
i
Cosa ne pensa Hardware Corner
Nel marzo 2026 il sito ritiene che la 5080 abbia un rapporto prezzo/capacità sfavorevole per gli LLM locali: i 16 GB limitano i modelli a circa 28 miliardi di parametri con una quantizzazione aggressiva, e consiglia piuttosto la RTX 4080 a parità di memoria. È un parere basato sui prezzi dell'epoca: verifica l'andamento dei prezzi prima di decidere.

#I modelli che entrano in 16 GB

Le dimensioni indicate sono quelle dei file della libreria Ollama, consultati il 29 settembre 2026. Il margine è lo spazio che resta sui 16 GB prima di considerare il contesto, la cache e i buffer del motore.

Modelli per RTX 5080 (file Ollama, Q4 salvo indicazione)
ModelloFile OllamaMargine lordoVerdetto
Granite 4.2 8B5,3 GB10,7 GBMolto comodo
Qwen 3.5 9B6,6 GB9,4 GBUso molto agevole, testo e immagini
Gemma 4 12B7,6 GB8,4 GBComodo
Qwen3 14B9,3 GB6,7 GBUtilizzo agevole, contesto di 32k possibile
gpt-oss 20B14 GB2 GBEntra in memoria; è possibile usare un contesto lungo in MXFP4
Devstral Small 2 24B / Mistral Small 3.2 24B15 GB1 GBMargine troppo basso per un contesto utile
Qwen 3.5 27B17 GBManca 1 GBNon entra
Qwen3 30B19 GBMancano 3 GBNon entra

Il modello da 14 miliardi in Q4 è il modello denso più grande che si può usare comodamente: lascia quasi 7 GB per il contesto. I modelli da 24 miliardi lasciano solo un GB e superano la capacità della VRAM non appena il contesto cresce: la scheda è adatta a un 24B finché la conversazione resta breve, non per un agente. Il caso di gpt-oss 20B è a parte: secondo Ollama, i pesi degli esperti sono quantizzati in MXFP4 a 4,25 bit per parametro, il che gli permette di funzionare con 16 GB di memoria, e Hardware Corner lo ha testato su questa scheda con un contesto fino a 128k.

Un RAG locale aggiunge un modello di embedding: bge-m3 pesa 1,2 GB in Ollama, per un totale di 7,8 GB con Qwen 3.5 9B e 8,8 GB con Gemma 4 12B. Restano più di 7 GB per il contesto e la base di frammenti inseriti. Un agente di programmazione, invece, richiede un contesto di almeno 64.000 token secondo la documentazione di Ollama: con 16 GB, impone di scendere a un modello da 8 a 14 miliardi di parametri e di quantizzare la cache, anziché puntare a un 24B.

#Throughput misurato: velocità e limite della larghezza di banda

I numeri provengono da Hardware Corner, che effettua i test con llama.cpp su contesti da 4k a 128k. Non sono misure di QuelLLM.

Generazione su RTX 5080, token al secondo (Hardware Corner)
Modello (Q4_K, o MXFP4 per gpt-oss)Contesto 4kContesto 32kContesto 128kLettura prompt 4k
Qwen3 8B129,172,5non misurato6 410,1
Qwen3 14B80,651,9non misurato3 820,5
gpt-oss 20B (MXFP4)172,4149,3105,69 146,1

La generazione è limitata dalla banda passante: il limite teorico corrisponde approssimativamente alla banda passante divisa per il peso del modello. Per Qwen3 14B (9,3 GB), 960 ÷ 9,3 dà 103 token al secondo e il valore misurato a 4k, pari a 80,6, raggiunge il 78% di questo limite. gpt-oss 20B supera il suo limite apparente (960 ÷ 14 = 69) con 172 token al secondo, perché un modello con esperti legge a ogni token solo una parte dei suoi pesi: il limite si calcola sui pesi attivi, non sul file intero.

Il contesto incide sulla velocità. Qwen3 14B passa da 80,6 a 51,9 token al secondo tra 4k e 32k (-36 %), mentre gpt-oss 20B perde solo il 13 % tra i medesimi limiti (172,4 a 149,3). Se lavori su documenti lunghi, la scelta del modello conta di più della scheda.

#Contesto e cache KV: il vero limite dei 16 GB

Ollama imposta il contesto predefinito in base alla memoria video: la sua documentazione indica 4k token sotto i 24 GiB di VRAM e consiglia almeno 64.000 token per gli agenti, la ricerca web e gli strumenti di programmazione. Una RTX 5080 ha quindi un contesto predefinito di 4k: un agente avviato con le impostazioni predefinite perde rapidamente la cronologia. Aumentare il contesto richiede VRAM sotto forma di cache KV, e questo consumo va sottratto al margine disponibile indicato nella tabella qui sopra.

La leva principale è la quantizzazione della cache: secondo la FAQ di Ollama, q8_0 utilizza circa la metà della memoria di f16, con una perdita di precisione molto bassa, e richiede Flash Attention, che Ollama attiva automaticamente quando la scheda e il modello la supportano. Su 16 GB, l'ordine di priorità è semplice: scegliere un modello che lasci almeno 5-6 GB di margine, poi quantizzare la cache, poi aumentare il contesto gradualmente controllando ollama ps.

#Installare Ollama su una RTX 5080

  1. 01
    Verificare il driver
    Esegui nvidia-smi in un terminale: il driver deve essere alla versione 550 o successiva (551.61 su Windows) e la memoria totale visualizzata deve essere di circa 16 GB.
  2. 02
    Installare Ollama
    Installa Ollama dal sito ufficiale. L'API locale ascolta su http://localhost:11434.
  3. 03
    Avviare un modello
    Esegui ollama run qwen3:14b: il download di 9,3 GB avviene una volta. Per un modello più veloce, prova ollama run gpt-oss:20b (14 GB).
  4. 04
    Controllare la distribuzione
    In un secondo terminale, esegui ollama ps: la colonna Processore deve mostrare 100 % GPU. Una ripartizione CPU/GPU significa che il modello o il contesto supera la memoria disponibile sulla GPU.
  5. 05
    Regolare il contesto
    Imposta il contesto con OLLAMA_CONTEXT_LENGTH, poi esegui di nuovo ollama ps. Se manca il margine, imposta OLLAMA_FLASH_ATTENTION a 1 e OLLAMA_KV_CACHE_TYPE a q8_0 all'avvio.
Comandi di base
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Blackwell: MXFP4, NVFP4 e limite di potenza

La 5080 accelera a livello hardware i formati a virgola mobile a 4 bit: Hardware Corner indica che supporta MXFP4 e NVFP4, e il vantaggio si vede su gpt-oss 20B, i cui pesi sono forniti in MXFP4. NVIDIA descrive NVFP4 come un formato a virgola mobile a 4 bit introdotto con Blackwell. Il supporto di NVFP4 negli strumenti (llama.cpp, Ollama, vLLM) evolve rapidamente: verifica la versione installata e la scheda del modello, e mantieni Q4_K_M come scelta affidabile.

Flash Attention 3 è riservato a Hopper (H100) secondo il repository ufficiale di Flash Attention: su una 5080 si usa la versione 2 oppure l'implementazione di Ollama e llama.cpp, e Ollama la attiva automaticamente quando è disponibile. Per ridurre il consumo, nvidia-smi -pl imposta un limite di potenza in watt; poiché il LLM sollecita soprattutto la memoria, la perdita di velocità è modesta, ma misurala sul tuo modello.

Limitare la potenza (sono richiesti privilegi di amministratore)
sudo nvidia-smi -pl 300

#5080, 5070 Ti, 4080 Super, 3090: la differenza misurata

Generazione relativa per scheda (Hardware Corner, 5080 = 100 %)
SchedaMemoriaGenerazione relativa
RTX 409024 GB123 %
RTX 508016 GB100 %
RTX 5070 Ti16 GB91 %
RTX 3090 Ti24 GB89 %
RTX 4080 Super16 GB82 %
RTX 309024 GB81 %

Questa tabella mostra tre cose. La 5070 Ti, anch'essa con 16 GB, raggiunge il 91% della velocità della 5080: in termini di puro throughput, il divario è ridotto. La 3090, all'81%, è quasi altrettanto veloce e dispone di 24 GB, il che cambia la gamma di modelli utilizzabili (Qwen 3.5 27B entra nella sua memoria, ma non in quella della 5080). Infine, la 4090 è più veloce del 23% e offre anch'essa 24 GB. Per un utilizzo esclusivamente con LLM, quindi, conta meno la velocità che la capacità.

#Verdetto: quando vale la pena scegliere la 5080

Quale scelta fare in base alla tua situazione
SituazioneDecisioneMotivazione supportata da dati numerici
Modelli da 8 a 20 miliardi, uso rapido5080 adatta64 t/s su un 14B, 105,6 t/s su gpt-oss 20B a 128k
Vuoi un 27B densoScegliere una scheda da 24 GBQwen 3.5 27B pesa 17 GB, la 5080 ha 16 GB
Budget limitato per 16 GBConfrontare 5070 Ti e 4080 Super91 % e 82 % della velocità della 5080
Hai già una 4080 o 4080 SuperTenerlaStessa capacità di 16 GB
Hai già una 5070 TiTenerla91 % della velocità della 5080, stessa capacità

La 5080 è una buona scheda da 16 GB il cui difetto, per gli LLM, è non avere più memoria delle altre schede più economiche della stessa fascia. Prima di acquistare, poniti una sola domanda: qual è il modello denso più grande che vuoi eseguire? Fino a 14 miliardi di parametri, 16 GB bastano e la velocità della 5080 si fa sentire; oltre questa soglia, la capacità conta più della velocità, e una scheda usata da 24 GB permette di eseguire più modelli a una velocità simile. Per i prezzi del giorno, consulta il nostro monitoraggio, che rileva il prezzo più basso di ogni scheda due volte a settimana.

#Domande frequenti

FAQ
Quale LLM installare su una RTX 5080?+
Inizia con Qwen3 14B: il suo file Ollama di 9,3 GB lascia quasi 7 GB di margine e genera 80,6 token al secondo a 4k secondo Hardware Corner. Per una maggiore velocità, gpt-oss 20B (14 GB) supera i 170 token al secondo a 4k. Per un uso comune, Qwen 3.5 9B (6,6 GB) è il più leggero.
La RTX 5080 può eseguire un modello 70B?+
No. Llama 3.3 70B pesa 43 GB in Q4, quasi tre volte i 16 GB della scheda. Se viene distribuito tra la memoria della scheda e la RAM, il throughput crolla, perché un modello denso rilegge tutti i suoi pesi a ogni token. Per un 70B servono due schede da 24 GB, una 5090 con più memoria o una macchina con memoria unificata.
RTX 5080 o RTX 5070 Ti per un LLM locale?+
Entrambe hanno 16 GB, quindi possono eseguire gli stessi modelli. Secondo Hardware Corner, la 5070 Ti raggiunge il 91% della velocità di generazione della 5080. Confronta la differenza di prezzo: a parità di capacità, una differenza di velocità del 9% giustifica raramente un sovrapprezzo significativo. Il monitoraggio dei prezzi indica i prezzi attuali.
16 GB sono sufficienti per un LLM nel 2026?+
Sì per i modelli da 8 a 14 miliardi di parametri e per gpt-oss 20B, che coprono la chat, la programmazione leggera e il RAG. No per quelli da 27 a 32 miliardi in Q4, che pesano da 17 a 20 GB. I modelli da 24 miliardi (15 GB) entrano in memoria, ma senza margine per un contesto lungo.
Quale alimentatore per una RTX 5080?+
NVIDIA indica un alimentatore da 850 W come requisito per il sistema, a fronte di una potenza grafica di 360 W. Sono i valori del produttore per un PC completo. Un limite di potenza riduce il consumo della scheda a costo di una diminuzione della velocità da misurare sul tuo modello, senza modificare l'alimentatore consigliato.
La RTX 5080 supporta FP4?+
Sì: secondo Hardware Corner, supporta MXFP4 e NVFP4 a livello hardware. Il vantaggio si vede su gpt-oss 20B, fornito in MXFP4 e misurato a 172 token al secondo a 4k. Per gli altri modelli, Q4_K_M rimane il formato più comune: il FP4 dipende dalla disponibilità del file convertito.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.