Migliore GPU per l'IA locale sotto i 2000 € nel 2026
Scegliere il migliore GPU per l'IA sotto i 2000 euro richiede soprattutto di trovare un equilibrio tra VRAM disponibile, larghezza di banda della memoria e compatibilità con i framework di inferenza open-source. Nel 2026, la RTX 4090, la RTX 5090 e la RX 7900 XTX occupano posizioni molto diverse in questo segmento, ciascuna con i propri compromessi per eseguire LLM in locale. Questo articolo illustra nel dettaglio le specifiche chiave di ogni GPU, i modelli del catalogo accessibili in base alla configurazione, le prestazioni attese per ciascuna quantizzazione e risponde alle domande più frequenti prima dell'acquisto.
Perché la VRAM è la metrica determinante per gli LLM locali
A differenza dei videogiochi o del rendering 3D, l'esecuzione locale di un LLM dipende fortemente dalla capacità di memoria video. La VRAM determina quale quantizzazione è utilizzabile e in quale misura il modello deve essere trasferito nella RAM di sistema.
Le quantizzazioni più comuni attraverso llama.cpp, il motore di inferenza di riferimento per l'inferenza locale, sono:
- Q4_K_M : compromesso qualità/dimensione più diffuso, circa 4,5 bit per parametro
- Q5_K_M : leggero miglioramento della qualità, circa 5,5 bit per parametro
- Q8_0 : vicino alla precisione nativa, circa 8 bit per parametro
- FP16 : 16 bit per parametro, riservato alle configurazioni multi-GPU dotate di centinaia di GB di VRAM
Per capire tutti gli effetti della quantizzazione, consulta il guida alla quantizzazione degli LLM del sito.
Come riferimento sui modelli indicizzati nel catalogo quelllm.fr :
- Qwen 2.5 72B Instruct — circa 42 GB in Q4, 72 miliardi di parametri: supera la VRAM di una singola GPU sotto i 2.000 €
- Llama 4 Scout 109B — ~65 GB in Q4, 109B parametri: richiede un offload massiccio sulla CPU
- gpt-oss 120B — ~70 GB in Q4, 117B parametri: stessa constatazione
La conseguenza diretta: con una sola GPU sotto i 2 000 €, tutti i modelli del catalogo (minimo 71B parametri) si eseguono in modalità offload parziale verso la RAM di sistema, il che riduce i token/sec in proporzione alla quantità trasferita.
GPU disponibili sotto 2.000 € nel 2026
Ecco le schede grafiche adatte all'inferenza LLM locale in questa fascia di prezzo (prezzi rilevati in Francia a metà 2026, da confermare in base ai rivenditori e alle fluttuazioni del mercato):
NVIDIA GeForce RTX 4090 - VRAM : 24 GB GDDR6X - Banda passante della memoria : 1.008 GB/s - Prezzo indicativo : 1 400–1 700 € - Compatibilità : CUDA nativo, llama.cpp, vLLM, Ollama, ExLlamaV2 - Punto di forza : ecosistema più ampio, documentazione comunitaria abbondante
NVIDIA GeForce RTX 5090 - VRAM : 32 GB GDDR7 - Banda passante della memoria : stimata ~1 790 GB/s - Prezzo indicativo : 1.900–2.200 € a seconda del rivenditore (al limite del budget previsto) - Compatibilità : CUDA nativo, architettura Blackwell supportata nelle versioni recenti di llama.cpp - Punto di forza : 8 GB in più rispetto alla RTX 4090, riduzione dell'offload CPU sui modelli 70B
AMD Radeon RX 7900 XTX - VRAM : 24 GB GDDR6 - Banda passante della memoria : 960 GB/s - Prezzo indicativo : 800–1 050 € - Compatibilità : ROCm 6.x, llama.cpp tramite backend HIP, Ollama - Punto di forza : migliore rapporto VRAM/prezzo del segmento, una scelta praticabile se il tuo stack supporta ROCm
NVIDIA GeForce RTX 3090 (mercato secondario) - VRAM : 24 GB GDDR6X - Prezzo indicativo : 600–850 € - Punto di forza : stessa capacità VRAM della RTX 4090 a prezzo ridotto - Punto debole : banda passante leggermente inferiore (~936 GB/s), architettura più vecchia (Ampere)
NVIDIA GeForce RTX 5080 - VRAM : 16 GB GDDR7 - Prezzo indicativo : 900–1 100 € - Punto debole : 16 GB insufficienti per i modelli 70B anche in Q3_K_M — non consigliato per i LLM del catalogo
Per una comparazione approfondita dei due leader del settore, consultare la pagina RTX 4090 vs RTX 5090 per gli LLM.
RTX 4090 vs RTX 5090: l'analisi per gli LLM
La RTX 5090 offre 8 GB di VRAM in più e una banda passante significativamente aumentata. Per i LLM, questo si traduce in tre vantaggi concreti:
Riduzione dell'offload CPU : con 32 GB di VRAM, trasferisci meno livelli nella RAM di sistema per un modello 70B in Q4 (~42 GB richiesti). In Q3_K_M, la memoria occupata da un modello 72B scende a circa 30–32 GB (stima), il che può consentire un'esecuzione interamente in VRAM a seconda dell'implementazione.
Più token al secondo : meno offload significa meno colli di bottiglia sul bus PCIe (limitato a circa 32 GB/s su PCIe 5.0 x16, contro 1.008 GB/s per la larghezza di banda interna della RTX 4090). La differenza è direttamente percepibile nella velocità di inferenza.
Costo aggiuntivo : tra 400 e 700 € di più secondo il rivenditore. Se la RTX 5090 scende sotto i 2.000 €, i 32 GB giustificano il sovraccosto. Altrimenti, la RTX 4090 rimane la scelta più coerente.
La RX 7900 XTX merita una menzione speciale per i budget inferiori a 1.050 €: 24 GB di VRAM con supporto ROCm in costante miglioramento. La compatibilità non è ancora altrettanto fluida quanto quella di CUDA su tutti gli strumenti (in particolare vLLM), ma llama.cpp tramite HIP funziona correttamente per l'inferenza locale standard.
Le specifiche ufficiali della serie RTX 50 sono consultabili sulla pagina prodotto NVIDIA.
Modelli accessibili con una GPU da meno di 2.000 € (offload incluso)
Ecco cosa è realistico in base al catalogo quelllm.fr, con una GPU da 24–32 GB di VRAM abbinata a 64–128 GB di RAM di sistema DDR5:
Modelli 70B — la classe di riferimento con offload parziale
- Qwen 2.5 72B Instruct — 72B parametri, licenza Qwen, ~42 GB Q4. Con 24 GB di VRAM, circa 18 GB vengono offloadati sulla RAM. Velocità stimata: 4–9 token/sec in base alla banda passante RAM e al numero di layer offloadati.
- Llama 3.1 70B LatamGPT SFT — 71B parametri, licenza Llama 3.1 Community, ~41 GB in Q4. Requisiti simili, modello leggermente più compatto.
- Qwen3-Coder-Next 80B-A3B — 80B parametri, ~48 GB Q4, licenza Apache 2.0. Richiede un maggiore offload ma è adatto per le attività di generazione di codice.
- Hunyuan-A13B Instruct — 80B parametri, ~48 GB Q4, licenza Tencent Hunyuan. Architettura MoE con 13B parametri attivi — il carico di calcolo effettivo è ridotto anche se l'impronta di memoria rimane identica.
Quello che resta fuori portata su GPU singola
- DeepSeek R1 671B — ~400 GB Q4: richiede un minimo di 10 GPU di questa gamma in parallelo, o un server NVLink dedicato.
- Llama 4 Maverick 400B — ~240 GB Q4: fuori portata in configurazione mono-GPU.
- Qwen 3 235B-A22B — ~142 GB in Q4: non utilizzabile su una singola GPU, ma il confronto Qwen 3 235B vs Llama 4 Scout illustra in dettaglio le differenze per le configurazioni multi-GPU.
Per individuare i modelli filtrati in base alla VRAM a tua disposizione, usa direttamente il configuratore quelllm.fr.
Prestazioni attese: token/sec in base alla GPU
I numeri qui sotto sono stimati a partire dai benchmark della comunità raccolti nelle issue e nelle discussioni del repository llama.cpp su GitHub e del classifica Open LLM di Hugging Face. Variano in base alla RAM del sistema, alla versione del motore di inferenza e alla configurazione PCIe.
Per un modello 70B in Q4_K_M (circa 42 GB), offload parziale :
- RTX 5090 (32 GB) : stima di 10–18 token/sec, offload minimo (~10 GB su CPU)
- RTX 4090 (24 GB) : velocità stimata di 4–9 token/sec, ~18 GB trasferiti nella RAM DDR5 veloce tramite offloading
- RX 7900 XTX (24 GB) : stimato 3–7 token/sec tramite ROCm/HIP, da confermare in base alla versione del driver
- RTX 3090 (24 GB) : velocità stimata di 3–6 token/sec, con una banda passante leggermente inferiore
Per un modello 70B in Q3_K_M (stimato ~30–32 GB), vicino al limite della RTX 5090 :
- RTX 5090 (32 GB) : velocità stimata di 20–30 token/sec se il modello entra interamente nella VRAM
Questi numeri illustrano l'importanza fondamentale della larghezza di banda della memoria interna : eliminare l'offload sulla CPU moltiplica la velocità di inferenza da due a quattro volte rispetto a un offload parziale.
Licenze dei modelli: cosa cambia in base all'uso
La VRAM disponibile determina quali modelli sono accessibili e quindi quali licenze si applicano al tuo deployment. Riepilogo delle licenze dei modelli della classe 70–120B del catalogo:
- Apache 2.0 — uso commerciale libero, redistribuzione autorizzata : Mixtral 8x22B Instruct (~82 GB Q4), Qwen3-Coder-Next 80B-A3B (~48 GB Q4), gpt-oss 120B (~70 GB Q4)
- MIT — licenza molto permissiva, uso commerciale libero: dots.llm1 Instruct (~85 GB Q4), Mistral Medium 3.5 128B (~74 GB Q4, Modified MIT)
- Llama Community — uso commerciale a determinate condizioni (MAU < 700M per le entità interessate): Llama 4 Scout 109B (~65 GB Q4)
- Qwen License — uso commerciale consentito secondo le condizioni Alibaba : Qwen 2.5 72B Instruct (~42 GB Q4)
Per ogni progetto a carattere commerciale, controlla sempre le condizioni esatte sulle schede dei singoli modelli prima del deploy. Le licenze Apache 2.0 e MIT offrono la massima flessibilità.
FAQ
D: È possibile eseguire un modello 70B su una RTX 4090?
Sì, con un offload parziale nella RAM di sistema. La RTX 4090 dispone di 24 GB di VRAM; un modello come il Qwen 2.5 72B Instruct, che richiede circa 42 GB in Q4, trasferisce circa 18 GB nella RAM DDR5. La velocità di inferenza si aggira intorno a 4–9 token/sec (stima), un valore ancora utilizzabile per un uso interattivo non in tempo reale, a condizione di disporre di almeno 64 GB di RAM di sistema e di una CPU con una larghezza di banda della memoria sufficiente.
Q: La RTX 5090 entra in un budget di 2000 € in Francia?
È al limite del budget: tra 1.900 e 2.200 € a seconda dei rivenditori a metà 2026. Se la trovi sotto i 2.000 €, i suoi 32 GB di VRAM e la sua banda passante superiore a quella della RTX 4090 riducono significativamente l'offload CPU sui modelli 70B, migliorando così la velocità di inferenza. Altrimenti, la RTX 4090 resta la scelta più accessibile e meglio supportata dall'ecosistema degli strumenti locali.
Q: AMD RX 7900 XTX o NVIDIA RTX 4090 per i LLM locali?
La RX 7900 XTX offre 24 GB di VRAM a 800–1 050 €, cioè 600–700 € in meno rispetto alla RTX 4090. In compenso, l'ecosistema ROCm è meno maturo di CUDA: vLLM e alcuni backend richiedono una configurazione manuale, e le prestazioni tramite HIP rimangono inferiori a quelle di CUDA nella pratica. Per llama.cpp e Ollama nell'uso standard, la RX 7900 XTX funziona correttamente. Per uno stack più complesso o per il deployment applicativo, la RTX 4090 semplifica l'implementazione.
Q: Quanta RAM di sistema bisogna prevedere in aggiunta alla GPU?
Per l'offload di modelli 70B in Q4, 64 GB di RAM DDR5 rappresentano un minimo ragionevole. 128 GB permettono di riservare spazio per il sistema operativo e altri processi paralleli. La banda della RAM (DDR5 dual-channel ad alta frequenza) influenza direttamente la velocità di inferenza durante l'offload: una DDR5-6000 dual-channel offre un vantaggio percepibile rispetto a una DDR4-3200.
Q: La RTX 5080 (16 GB) può eseguire i modelli del catalogo?
No. 16 GB di VRAM non sono sufficienti per nessuno dei modelli del catalogo (minimo 71B parametri). Anche in Q3_K_M, un modello da 70B richiede circa 30–32 GB (stima). La RTX 5080 è adatta ai modelli da 7 a 34B, che non figurano in questo catalogo incentrato sui LLM di grandi dimensioni. Consulta la nostra guida alle GPU di alto livello per LLM per le configurazioni multi-GPU su scala più ampia.
Q: La quantizzazione Q4 degrada significativamente la qualità delle risposte?
La quantizzazione Q4_K_M preserva le capacità essenziali di un modello rispetto a FP16 nella maggior parte delle attività di comprensione e generazione di testo. I cali di qualità più marcati si manifestano nelle attività di ragionamento matematico complesso e di scrittura di codice preciso, per le quali Q5_K_M o Q8_0 sono preferibili se la VRAM lo permette. Le quantizzazioni Q3 e inferiori mostrano perdite più visibili e vanno riservate ai casi in cui la VRAM è il fattore limitante assoluto.
Conclusione
Nel 2026, il migliore GPU per l'IA sotto i 2000 euro è la RTX 4090 per la sua maturità software, i 24 GB di VRAM GDDR6X e il suo ecosistema CUDA privo di complicazioni. Se il tuo budget raggiunge il limite superiore e la RTX 5090 è disponibile a meno di 2.000 €, i 32 GB giustificano il sovrapprezzo grazie alla riduzione dell'offload sulla CPU. La RX 7900 XTX resta l'alternativa più convincente sotto i 1.050 €. Per trovare i modelli compatibili con la tua configurazione esatta, usa il configuratore quelllm.fr o sfoglia per intero il catalogo dei 249 LLM indicizzati.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QualeLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.