Quale LLM su RTX 4080 / 4080 Super (16 GB) ?
La RTX 4080 e la 4080 Super dispongono entrambe di 16 GB di GDDR6X (716,8 e 736 GB/s): caricano in VRAM tutti i modelli fino a circa 14 GB, tra cui Gemma 4 12B, gpt-oss 20B e Mistral Small 24B. Una rilevazione pubblica di terzi misura 106 token/s su un modello da 8B in Q4 con una RTX 4080. La differenza tra le due varianti è di circa il 3% in termini di larghezza di banda: non giustifica un sovrapprezzo significativo.
La RTX 4080 e la 4080 Super sono le schede da 16 GB di fascia alta della generazione Ada. Per un LLM locale, si distinguono meno l’una dall’altra che dalle concorrenti con la stessa capacità: RTX 4070 Ti Super, RTX 5070 Ti, RTX 5080. Questa guida quantifica la differenza reale tra le due varianti, ciò che 16 GB possono gestire e l’unica misura pubblicata della velocità di generazione disponibile per questa scheda.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: RTX 5080 16 GB.
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#RTX 4080 per un LLM locale: ciò che 16 GB e 716 GB/s permettono
Una RTX 4080 o 4080 Super carica in VRAM qualsiasi modello da 4B a 24B in Q4: Gemma 4 12B (da 7,7 a 8 GB), gpt-oss 20B (14 GB) e Mistral Small 24B (14 GB) ci stanno, quest'ultimo con circa 2 GB di margine per il contesto. La misurazione di terzi citata più sotto rileva 106 token/s in generazione su un modello da 8B in Q4 con una RTX 4080, il che colloca la scheda tra quelle veloci per un uso interattivo. Il limite è la capacità: Qwen 3.5 27B pesa 17 GB secondo Ollama e non entra nella VRAM. Per modelli di queste dimensioni, servono 24 GB di VRAM. La 4080 è quindi una scheda che punta sulla velocità per i modelli medi, non sulla capacità.
- Architettura
- Ada Lovelace, chip AD103.
- Memoria
- 16 GB di GDDR6X su un bus da 256 bit: 716,8 GB/s (4080) e 736 GB/s (4080 Super) secondo Wikipedia.
- Core CUDA
- 9 728 (4080) e 10 240 (4080 Super) secondo NVIDIA.
- Potenza
- 320 W di potenza grafica totale nelle due varianti; NVIDIA indica 750 W di alimentazione minima per il PC.
- Prezzo di lancio
- 1.199 dollari nel novembre 2022 per la 4080, poi 999 dollari per la 4080 Super nel gennaio 2024.
#4080 o 4080 Super: la differenza reale per il LLM
La Super aggiunge il 5% di core CUDA (10.240 contro 9.728) e il 2,7% di banda passante (736 contro 716,8 GB/s). Nella generazione di testo, solo la banda passante conta davvero: il guadagno teorico è quindi inferiore al 3%, impercettibile nell'uso pratico. Le due schede hanno la stessa capacità di 16 GB e lo stesso consumo di 320 W, quindi possono caricare gli stessi modelli. Una 4080 Super giustifica un sovrapprezzo solo se viene venduta allo stesso prezzo o quasi. I prezzi dell'usato cambiano ogni settimana: consulta il monitoraggio dei prezzi anziché un valore fisso.
| Criterio | RTX 4080 | RTX 4080 Super |
|---|---|---|
| Core CUDA | 9 728 | 10 240 |
| Memoria | 16 GB GDDR6X, 256 bit | 16 GB GDDR6X, 256 bit |
| Larghezza di banda | 716,8 GB/s | 736 GB/s |
| Potenza grafica | 320 W | 320 W |
| Alimentazione minima | 750 W | 750 W |
| Differenza di banda passante | riferimento | circa il 2,7 % in più |
#Quali modelli stanno in 16 GB
| Modello | Dimensione | Margine su 16 GB | Verdetto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Contesto molto lungo possibile |
| Gemma 4 12B | Da 7,7 a 8,0 GB | 8 GB | Comodo |
| gpt-oss 20B | 14 GB | 2 GB | Rientra nella memoria disponibile, con un contesto moderato |
| Mistral Small 24B | 14 GB | 2 GB | Rientra nella memoria disponibile, con un contesto moderato |
| Qwen 3.5 27B | 17 GB | Negativo | Non entra in VRAM |
Ollama utilizza di default un contesto di 4.096 token. Con 2 GB di margine, un modello da 14 GB supporta un contesto più lungo a patto di quantizzare la cache K/V: Ollama propone il formato q8_0, che utilizza circa la metà della memoria del f16, con Flash Attention. Queste due impostazioni sono la chiave per utilizzare gpt-oss 20B o Mistral Small 24B con un contesto di 16.000 token.
#La sola misura pubblicata: ciò che dice della 4080
Un repository GitHub pubblico confronta GPU con llama.cpp su LLaMA 3 (istantanea di maggio 2024, sistema Ubuntu, RunPod). Per la RTX 4080 da 16 GB, riporta 106,22 token/s nella generazione di 1024 token con un modello 8B in Q4_K_M e 40,29 token/s con lo stesso modello in F16, che occupa 14,96 GB, quasi tutta la memoria della scheda. Si tratta di misurazioni effettuate da terzi, su un modello più vecchio di quelli del sito, con una versione precedente di llama.cpp: da leggere come un ordine di grandezza, non come una promessa.
| Passo | 512 token | 1.024 token | 8 192 token |
|---|---|---|---|
| Generazione (token/s) | 108,15 | 106,22 | 93,71 |
| Lettura del prompt (token/s) | 5 389,74 | 5 064,99 | 2 882,03 |
Due insegnamenti. Primo, la generazione rallenta con il contesto: passare da 512 a 8.192 token di contesto comporta una perdita di circa il 13% in questa misurazione, perché la cache K/V si aggiunge ai pesi letti a ogni token. In secondo luogo, si può calcolare il rapporto tra il valore misurato e il limite teorico: 716,8 GB/s divisi per i 4,58 GB del modello 8B in Q4 danno 156 token/s; il valore misurato raggiunge il 68% di questo limite. In F16, il limite è di 48 token/s e il valore misurato ne raggiunge l'84%. Il rapporto varia quindi dal 68% all'84% a seconda del formato.
| Modello (Q4) | Dimensione del modello | Tetto | Stima al 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 135 token/s | circa 95 token/s |
| Gemma 4 12B | 7,7 GB | 93 token/s | circa 65 token/s |
| Mistral Small 24B | 14 GB | 51 token/s | circa 36 token/s |
Queste stime valgono per un contesto breve. Il modello gpt-oss 20B legge soltanto gli esperti attivi per ogni token: supera un modello denso da 14 GB, senza che qui venga ripresa una misura affidabile.
#Leggere il prompt è molto più veloce che generare
La stessa rilevazione misura anche l'elaborazione del prompt, cioè la lettura della tua domanda e dei tuoi documenti prima della prima risposta: 5.065 token/s per 1.024 token e 2.882 token/s per 8.192 token. Un documento di circa 8.000 token, una quindicina di pagine, viene quindi letto in circa tre secondi prima che inizi la generazione. Questa fase è limitata dalla capacità di calcolo e non dalla banda passante, ed è qui che si nota il vantaggio dei core aggiuntivi della 4080 rispetto a una scheda con una banda passante di 288 GB/s come la 4060 Ti.
#Usi che beneficiano di una 4080: agenti, RAG, codice
Una scheda con questa velocità è adatta agli usi che richiedono molte generazioni consecutive: agenti, cicli di correzione del codice, elaborazione in batch di documenti. A 100 token/s con un modello 8B, un agente che produce 500 token per passaggio risponde in pochi secondi. I 16 GB limitano invece la dimensione del contesto e il numero di modelli caricati: tieni caricato un solo modello 12B che occupa 14 GB, più un piccolo modello di embedding per un RAG. Un modello di ragionamento come gpt-oss 20B produce lunghe riflessioni prima della risposta, consumando così spazio nel contesto.
| Uso | Configurazione | Aspetto da tenere presente |
|---|---|---|
| Assistente di programmazione | Modello da 8B a 12B, contesto di 16.000 token, cache q8_0 | Modelli per il codice da 15 GB in su: contesto quasi nullo |
| RAG sui documenti | Gemma 4 12B e un modello di embedding leggero | Caricare soltanto un modello di generazione |
| Chat di qualità | Mistral Small 24B da solo | Contesto moderato, 2 GB di margine |
#Il modello rallenta: verificare che entri interamente in VRAM
Con 16 GB, un modello da 14 GB lascia poco margine, e un contesto che cresce può far sì che il modello superi la capacità della VRAM durante la conversazione. Il sintomo è una generazione che diventa improvvisamente più lenta: una parte del modello è stata trasferita nella RAM di sistema. Questa verifica richiede un minuto ed evita di concludere erroneamente che la scheda sia lenta, quando invece la causa è l'impostazione del contesto.
- 01Osservare l'allocazioneEsegui ollama ps in un secondo terminale: la colonna PROCESSOR deve mostrare 100 % GPU. Una ripartizione CPU/GPU segnala che parte del modello è stata trasferita nella RAM di sistema.
- 02Ridurre il contestoRiduci OLLAMA_CONTEXT_LENGTH a 8192, oppure al suo valore predefinito di 4096, poi riavvia il server.
- 03Quantizzare la cacheAttiva Flash Attention e OLLAMA_KV_CACHE_TYPE=q8_0: la cache K/V utilizza circa la metà della memoria rispetto al formato f16.
- 04Liberare la VRAMChiudi le applicazioni che occupano la scheda, come giochi e browser con accelerazione hardware, e verifica con nvidia-smi.
- 05Cambiare il modelloSe nessuna soluzione è sufficiente, passa a un modello più leggero, ad esempio Gemma 4 12B al posto di Mistral Small 24B.
#4080 contro la 4070 Ti Super, la 5070 Ti e la 5080
| Scheda | VRAM | Larghezza di banda | Differenza rispetto alla 4080 |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | circa il 6 % in meno |
| RTX 4080 | 16 GB GDDR6X | 716,8 GB/s | riferimento |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | circa il 3 % in più |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | circa il 25 % in più |
| RTX 5080 | 16 GB GDDR7 | 960 GB/s | circa il 34 % in più |
Tutte queste schede caricano gli stessi modelli, poiché la capacità è identica. Varia solo il throughput, in proporzione alla banda passante. La 4080 si distingue dalla 4070 Ti Super solo del 6 %: se la differenza di prezzo è significativa, la Ti Super è un acquisto migliore. Rispetto alle schede della generazione 50, la 4080 è dal 20 al 25 % più lenta, ma resta senza rivali se il prezzo dell'usato è basso. Questa scelta si basa sul prezzo, non sulla scheda tecnica.
- Quale LLM su RTX 4070 Ti Super
- Quale LLM su RTX 5070 Ti
- Quale LLM su RTX 5080
- Prezzi delle schede grafiche per l'IA locale
#Verdetto 2026: tenere, acquistare o lasciar perdere
- Tieni la tua 4080 se
- I tuoi modelli rientrano in 16 GB. La scheda resta veloce e nulla giustifica la sua sostituzione finché non avrai bisogno di 24 GB.
- Acquistala usata se
- Il suo prezzo è nettamente inferiore a quello di una 5070 Ti nuova, la cui larghezza di banda è superiore di circa il 25%.
- Punta a 24 GB se
- Vuoi modelli da 27B o più: nessuna impostazione permette di far stare 17 GB in 16 GB includendo il contesto.
Una scheda del 2022 o 2023 potrebbe essere stata usata per il mining o per sessioni di gioco intensive: chiedi la fattura originale se esiste e preferisci un venditore che accetti il reso. Prima di acquistare una scheda usata, verifica con nvidia-smi che mostri 16 GB, avvia un modello da 14 GB e monitora la temperatura durante una generazione lunga. La scheda consuma fino a 320 W: controlla l'alimentatore, NVIDIA ne consiglia uno da almeno 750 W.
- Fonte: caratteristiche ufficiali NVIDIA (RTX 4080 e 4080 Super)
- Fonte: rilevazione di terze parti delle velocità di generazione di llama.cpp su GPU (GitHub)
- Fonte: FAQ ufficiale di Ollama (Flash Attention, cache K/V)
#Domande frequenti
Qual è la differenza tra RTX 4080 e 4080 Super per un LLM?+
Qual è la velocità di generazione su una RTX 4080?+
La RTX 4080 può eseguire Qwen 3.5 27B?+
RTX 4080 Super o RTX 4070 Ti Super per un LLM?+
Quale alimentatore serve per una RTX 4080?+
Vale la pena acquistare una RTX 4080 usata per un LLM?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.