Intermedio 11 minRTX 40

Quale LLM su RTX 4080 / 4080 Super (16 GB) ?

Risposta diretta

La RTX 4080 e la 4080 Super dispongono entrambe di 16 GB di GDDR6X (716,8 e 736 GB/s): caricano in VRAM tutti i modelli fino a circa 14 GB, tra cui Gemma 4 12B, gpt-oss 20B e Mistral Small 24B. Una rilevazione pubblica di terzi misura 106 token/s su un modello da 8B in Q4 con una RTX 4080. La differenza tra le due varianti è di circa il 3% in termini di larghezza di banda: non giustifica un sovrapprezzo significativo.

La RTX 4080 e la 4080 Super sono le schede da 16 GB di fascia alta della generazione Ada. Per un LLM locale, si distinguono meno l’una dall’altra che dalle concorrenti con la stessa capacità: RTX 4070 Ti Super, RTX 5070 Ti, RTX 5080. Questa guida quantifica la differenza reale tra le due varianti, ciò che 16 GB possono gestire e l’unica misura pubblicata della velocità di generazione disponibile per questa scheda.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: RTX 5080 16 GB.

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#RTX 4080 per un LLM locale: ciò che 16 GB e 716 GB/s permettono

Una RTX 4080 o 4080 Super carica in VRAM qualsiasi modello da 4B a 24B in Q4: Gemma 4 12B (da 7,7 a 8 GB), gpt-oss 20B (14 GB) e Mistral Small 24B (14 GB) ci stanno, quest'ultimo con circa 2 GB di margine per il contesto. La misurazione di terzi citata più sotto rileva 106 token/s in generazione su un modello da 8B in Q4 con una RTX 4080, il che colloca la scheda tra quelle veloci per un uso interattivo. Il limite è la capacità: Qwen 3.5 27B pesa 17 GB secondo Ollama e non entra nella VRAM. Per modelli di queste dimensioni, servono 24 GB di VRAM. La 4080 è quindi una scheda che punta sulla velocità per i modelli medi, non sulla capacità.

Architettura
Ada Lovelace, chip AD103.
Memoria
16 GB di GDDR6X su un bus da 256 bit: 716,8 GB/s (4080) e 736 GB/s (4080 Super) secondo Wikipedia.
Core CUDA
9 728 (4080) e 10 240 (4080 Super) secondo NVIDIA.
Potenza
320 W di potenza grafica totale nelle due varianti; NVIDIA indica 750 W di alimentazione minima per il PC.
Prezzo di lancio
1.199 dollari nel novembre 2022 per la 4080, poi 999 dollari per la 4080 Super nel gennaio 2024.

#4080 o 4080 Super: la differenza reale per il LLM

La Super aggiunge il 5% di core CUDA (10.240 contro 9.728) e il 2,7% di banda passante (736 contro 716,8 GB/s). Nella generazione di testo, solo la banda passante conta davvero: il guadagno teorico è quindi inferiore al 3%, impercettibile nell'uso pratico. Le due schede hanno la stessa capacità di 16 GB e lo stesso consumo di 320 W, quindi possono caricare gli stessi modelli. Una 4080 Super giustifica un sovrapprezzo solo se viene venduta allo stesso prezzo o quasi. I prezzi dell'usato cambiano ogni settimana: consulta il monitoraggio dei prezzi anziché un valore fisso.

RTX 4080 e 4080 Super: le due schede tecniche
CriterioRTX 4080RTX 4080 Super
Core CUDA9 72810 240
Memoria16 GB GDDR6X, 256 bit16 GB GDDR6X, 256 bit
Larghezza di banda716,8 GB/s736 GB/s
Potenza grafica320 W320 W
Alimentazione minima750 W750 W
Differenza di banda passanteriferimentocirca il 2,7 % in più

#Quali modelli stanno in 16 GB

Modelli su RTX 4080 (dimensioni Ollama, solo pesi)
ModelloDimensioneMargine su 16 GBVerdetto
Granite 4.2 8B5,3 GB10,7 GBContesto molto lungo possibile
Gemma 4 12BDa 7,7 a 8,0 GB8 GBComodo
gpt-oss 20B14 GB2 GBRientra nella memoria disponibile, con un contesto moderato
Mistral Small 24B14 GB2 GBRientra nella memoria disponibile, con un contesto moderato
Qwen 3.5 27B17 GBNegativoNon entra in VRAM

Ollama utilizza di default un contesto di 4.096 token. Con 2 GB di margine, un modello da 14 GB supporta un contesto più lungo a patto di quantizzare la cache K/V: Ollama propone il formato q8_0, che utilizza circa la metà della memoria del f16, con Flash Attention. Queste due impostazioni sono la chiave per utilizzare gpt-oss 20B o Mistral Small 24B con un contesto di 16.000 token.

Impostazioni del server Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

#La sola misura pubblicata: ciò che dice della 4080

Un repository GitHub pubblico confronta GPU con llama.cpp su LLaMA 3 (istantanea di maggio 2024, sistema Ubuntu, RunPod). Per la RTX 4080 da 16 GB, riporta 106,22 token/s nella generazione di 1024 token con un modello 8B in Q4_K_M e 40,29 token/s con lo stesso modello in F16, che occupa 14,96 GB, quasi tutta la memoria della scheda. Si tratta di misurazioni effettuate da terzi, su un modello più vecchio di quelli del sito, con una versione precedente di llama.cpp: da leggere come un ordine di grandezza, non come una promessa.

RTX 4080 16 GB: misure della rilevazione di terzi (LLaMA 3 8B in Q4_K_M, llama.cpp)
Passo512 token1.024 token8 192 token
Generazione (token/s)108,15106,2293,71
Lettura del prompt (token/s)5 389,745 064,992 882,03

Due insegnamenti. Primo, la generazione rallenta con il contesto: passare da 512 a 8.192 token di contesto comporta una perdita di circa il 13% in questa misurazione, perché la cache K/V si aggiunge ai pesi letti a ogni token. In secondo luogo, si può calcolare il rapporto tra il valore misurato e il limite teorico: 716,8 GB/s divisi per i 4,58 GB del modello 8B in Q4 danno 156 token/s; il valore misurato raggiunge il 68% di questo limite. In F16, il limite è di 48 token/s e il valore misurato ne raggiunge l'84%. Il rapporto varia quindi dal 68% all'84% a seconda del formato.

Limite teorico e stima su RTX 4080 (716,8 GB/s)
Modello (Q4)Dimensione del modelloTettoStima al 70 %
Granite 4.2 8B5,3 GB135 token/scirca 95 token/s
Gemma 4 12B7,7 GB93 token/scirca 65 token/s
Mistral Small 24B14 GB51 token/scirca 36 token/s

Queste stime valgono per un contesto breve. Il modello gpt-oss 20B legge soltanto gli esperti attivi per ogni token: supera un modello denso da 14 GB, senza che qui venga ripresa una misura affidabile.

#Leggere il prompt è molto più veloce che generare

La stessa rilevazione misura anche l'elaborazione del prompt, cioè la lettura della tua domanda e dei tuoi documenti prima della prima risposta: 5.065 token/s per 1.024 token e 2.882 token/s per 8.192 token. Un documento di circa 8.000 token, una quindicina di pagine, viene quindi letto in circa tre secondi prima che inizi la generazione. Questa fase è limitata dalla capacità di calcolo e non dalla banda passante, ed è qui che si nota il vantaggio dei core aggiuntivi della 4080 rispetto a una scheda con una banda passante di 288 GB/s come la 4060 Ti.

#Usi che beneficiano di una 4080: agenti, RAG, codice

Una scheda con questa velocità è adatta agli usi che richiedono molte generazioni consecutive: agenti, cicli di correzione del codice, elaborazione in batch di documenti. A 100 token/s con un modello 8B, un agente che produce 500 token per passaggio risponde in pochi secondi. I 16 GB limitano invece la dimensione del contesto e il numero di modelli caricati: tieni caricato un solo modello 12B che occupa 14 GB, più un piccolo modello di embedding per un RAG. Un modello di ragionamento come gpt-oss 20B produce lunghe riflessioni prima della risposta, consumando così spazio nel contesto.

Tre configurazioni tipiche su RTX 4080
UsoConfigurazioneAspetto da tenere presente
Assistente di programmazioneModello da 8B a 12B, contesto di 16.000 token, cache q8_0Modelli per il codice da 15 GB in su: contesto quasi nullo
RAG sui documentiGemma 4 12B e un modello di embedding leggeroCaricare soltanto un modello di generazione
Chat di qualitàMistral Small 24B da soloContesto moderato, 2 GB di margine

#Il modello rallenta: verificare che entri interamente in VRAM

Con 16 GB, un modello da 14 GB lascia poco margine, e un contesto che cresce può far sì che il modello superi la capacità della VRAM durante la conversazione. Il sintomo è una generazione che diventa improvvisamente più lenta: una parte del modello è stata trasferita nella RAM di sistema. Questa verifica richiede un minuto ed evita di concludere erroneamente che la scheda sia lenta, quando invece la causa è l'impostazione del contesto.

  1. 01
    Osservare l'allocazione
    Esegui ollama ps in un secondo terminale: la colonna PROCESSOR deve mostrare 100 % GPU. Una ripartizione CPU/GPU segnala che parte del modello è stata trasferita nella RAM di sistema.
  2. 02
    Ridurre il contesto
    Riduci OLLAMA_CONTEXT_LENGTH a 8192, oppure al suo valore predefinito di 4096, poi riavvia il server.
  3. 03
    Quantizzare la cache
    Attiva Flash Attention e OLLAMA_KV_CACHE_TYPE=q8_0: la cache K/V utilizza circa la metà della memoria rispetto al formato f16.
  4. 04
    Liberare la VRAM
    Chiudi le applicazioni che occupano la scheda, come giochi e browser con accelerazione hardware, e verifica con nvidia-smi.
  5. 05
    Cambiare il modello
    Se nessuna soluzione è sufficiente, passa a un modello più leggero, ad esempio Gemma 4 12B al posto di Mistral Small 24B.

#4080 contro la 4070 Ti Super, la 5070 Ti e la 5080

Schede da 16 GB: la stessa capacità, larghezze di banda diverse
SchedaVRAMLarghezza di bandaDifferenza rispetto alla 4080
RTX 4070 Ti Super16 GB GDDR6X672 GB/scirca il 6 % in meno
RTX 408016 GB GDDR6X716,8 GB/sriferimento
RTX 4080 Super16 GB GDDR6X736 GB/scirca il 3 % in più
RTX 5070 Ti16 GB GDDR7896 GB/scirca il 25 % in più
RTX 508016 GB GDDR7960 GB/scirca il 34 % in più

Tutte queste schede caricano gli stessi modelli, poiché la capacità è identica. Varia solo il throughput, in proporzione alla banda passante. La 4080 si distingue dalla 4070 Ti Super solo del 6 %: se la differenza di prezzo è significativa, la Ti Super è un acquisto migliore. Rispetto alle schede della generazione 50, la 4080 è dal 20 al 25 % più lenta, ma resta senza rivali se il prezzo dell'usato è basso. Questa scelta si basa sul prezzo, non sulla scheda tecnica.

#Verdetto 2026: tenere, acquistare o lasciar perdere

Tieni la tua 4080 se
I tuoi modelli rientrano in 16 GB. La scheda resta veloce e nulla giustifica la sua sostituzione finché non avrai bisogno di 24 GB.
Acquistala usata se
Il suo prezzo è nettamente inferiore a quello di una 5070 Ti nuova, la cui larghezza di banda è superiore di circa il 25%.
Punta a 24 GB se
Vuoi modelli da 27B o più: nessuna impostazione permette di far stare 17 GB in 16 GB includendo il contesto.

Una scheda del 2022 o 2023 potrebbe essere stata usata per il mining o per sessioni di gioco intensive: chiedi la fattura originale se esiste e preferisci un venditore che accetti il reso. Prima di acquistare una scheda usata, verifica con nvidia-smi che mostri 16 GB, avvia un modello da 14 GB e monitora la temperatura durante una generazione lunga. La scheda consuma fino a 320 W: controlla l'alimentatore, NVIDIA ne consiglia uno da almeno 750 W.

#Domande frequenti

FAQ
Qual è la differenza tra RTX 4080 e 4080 Super per un LLM?+
Quasi nessuna. La Super ha il 5% di core CUDA in più e il 2,7% di larghezza di banda in più (736 contro 716,8 GB/s), con la stessa memoria di 16 GB e la stessa potenza di 320 W. I modelli caricati sono gli stessi e la differenza di velocità, inferiore al 3%, non si nota nell'uso.
Qual è la velocità di generazione su una RTX 4080?+
Una misurazione pubblica effettuata da terzi rileva 106,22 token/s con LLaMA 3 8B in Q4_K_M usando llama.cpp, nel maggio 2024. Non è una misurazione effettuata qui, e il modello è più vecchio di quelli del sito. Il limite teorico per un modello da 5,3 GB è di circa 135 token/s.
La RTX 4080 può eseguire Qwen 3.5 27B?+
Non completamente in VRAM: il modello pesa 17 GB secondo Ollama, la scheda ha 16 GB. Una parte dei pesi rimarrebbe nella RAM di sistema, il che rallenta notevolmente la generazione. Per questo modello servono 24 GB di VRAM. Con 16 GB, scegli Mistral Small 24B o gpt-oss 20B, che pesano 14 GB.
RTX 4080 Super o RTX 4070 Ti Super per un LLM?+
Entrambe hanno 16 GB, quindi possono eseguire gli stessi modelli. La 4080 Super legge la memoria a 736 GB/s contro 672 GB/s, cioè circa il 10% in più: è il massimo guadagno di velocità nella generazione. Scegli la 4070 Ti Super se il prezzo di seconda mano è nettamente inferiore.
Quale alimentatore serve per una RTX 4080?+
NVIDIA indica 320 W di potenza grafica totale e una potenza minima dell'alimentatore di 750 W per l'intero PC. Controlla i connettori del tuo modello di scheda. Un alimentatore di qualità da 750 W è adeguato; una potenza superiore lascia margine se il processore è potente.
Vale la pena acquistare una RTX 4080 usata per un LLM?+
Sì, se il prezzo è nettamente inferiore a quello di una RTX 5070 Ti nuova, che ha la stessa capacità e una banda passante superiore di circa il 25%. Verifica con nvidia-smi che la scheda mostri 16 GB, esegui una generazione lunga e controlla la temperatura prima di acquistare.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.