Intermedio 14 minGPU

RTX 5090 e LLM locale: memoria, modelli, benchmark

RTX 5090 e LLM locale: capire cosa permettono 32 GB di VRAM, scegliere un modello identificabile e preparare un benchmark riproducibile. Le specifiche del produttore e le stime sono distinte dalle misurazioni.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-12·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Ciò che è verificato e ciò che non lo è

!
Correzione del 12 settembre 2026
I precedenti valori di velocità, i consumi misurati alla presa e i confronti di questa guida sono stati rimossi: i relativi file di misurazione non sono disponibili per la verifica. Questa pagina non presenta quindi alcun benchmark realizzato internamente sulla RTX 5090. Distingue le caratteristiche dichiarate dal produttore, le stime di memoria e il protocollo da eseguire.

La scheda tecnica NVIDIA indica 32 GB di GDDR7 per la RTX 5090, contro 24 GB per la RTX 4090. Questa differenza aumenta la memoria disponibile; non dimostra né una velocità di elaborazione né una qualità di risposta. Fonte del produttore: https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/

#Pesi, cache del contesto e margine per il runtime

Il file quantizzato, la cache KV e i buffer del runtime devono rientrare tutti insieme nella memoria disponibile. Un file da 32 GB non entra interamente in 32 GB di VRAM con un contesto utile. Ridurre il contesto, scegliere una quantizzazione più compatta o accettare un offload sulla CPU sono compromessi distinti.

Stima teorica dei soli pesi: parametri totali × bit per peso / 8, prima di includere i metadati e l'occupazione aggiuntiva dovuta alla quantizzazione. Questo calcolo non è né una misura della VRAM utilizzata né una garanzia di caricamento. Il numero di parametri attivi di un MoE non sostituisce mai il numero totale per stimare i pesi da memorizzare.

#Llama 4 Scout: la correzione essenziale

L'identificativo ufficiale è meta-llama/Llama-4-Scout-17B-16E-Instruct: 17 miliardi di parametri attivi, 109 miliardi in totale e 16 esperti. La precedente denominazione «17B-A2B» e la presunta occupazione di 17 GB erano errate. A quattro bit, 109 miliardi di pesi rappresentano già circa 54,5 GB decimali prima dell'overhead. Con questa quantizzazione, il modello non può risiedere interamente sulla GPU di una singola RTX 5090 da 32 GB.

Fonte primaria: https://huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct . L’offload sulla RAM o su più schede modifica il protocollo e la velocità di elaborazione. Non attribuiamo alcun risultato di velocità a questa configurazione non misurata.

#Un primo modello identificabile

Per iniziare, Qwen/Qwen3-8B e Qwen/Qwen3-14B sono due modelli identificabili pubblicati da Qwen. Inizia con una quantizzazione Q4 e un contesto di 4096 token, poi verifica dove viene effettivamente collocato il modello. L'8B lascia più margine; il 14B costituisce un'alternativa da confrontare sui tuoi compiti. Questa scelta iniziale non è una classifica di qualità verificata con test su RTX 5090.

Fonti: https://huggingface.co/Qwen/Qwen3-8B e https://huggingface.co/Qwen/Qwen3-14B ; distribuzioni Ollama: https://ollama.com/library/qwen3:8b e https://ollama.com/library/qwen3:14b. L'etichetta può evolvere: controlla il suo digest e la quantizzazione con ollama show avant per confrontare i risultati.

Primo tentativo con Ollama installato
ollama run qwen3:8b
# Dans la session interactive :
/set parameter num_ctx 4096
# Posez une question courte, puis contrôlez le placement dans un autre terminal :
ollama ps
ollama show qwen3:8b

#RTX 5090 e RTX 4090: confrontare senza falsi benchmark

La RTX 4090 non supporta NVLink. Due RTX 4090 non formano automaticamente un pool di 48 GB utilizzabile come una singola scheda. Il runtime può distribuire alcuni carichi tramite PCIe, con costi di comunicazione e vincoli propri del modello. Fonte NVIDIA: https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/

Confrontare soltanto la banda passante non permette di ricavare un fattore moltiplicativo affidabile per i token al secondo. L'elaborazione del prompt, la generazione, la quantizzazione, il contesto, i kernel e l'offload devono essere identici. Qui non viene rivendicato alcun vantaggio quantificato tra 5090/4090/3090 senza misurazioni comparabili.

#Protocollo riproducibile da applicare

Annotare il modello esatto della GPU e la VRAM tramite nvidia-smi, CPU, RAM, sistema operativo, driver, versione del runtime, identificativo e hash del modello, quantizzazione, contesto, batch e offload. Mantenere un solo utente e nessun altro carico sulla GPU durante il test. Eseguire un riscaldamento documentato, poi cinque ripetizioni con gli stessi input.

Conservare separatamente prompt_eval_count / prompt_eval_duration e eval_count / eval_duration nelle risposte JSON di Ollama. Le durate sono in nanosecondi. Pubblicare ogni ripetizione, la mediana e la dispersione, segnalando la cache del prompt. Fonte: https://docs.ollama.com/api/generate . La velocità di generazione non misura tutta la latenza percepita né la qualità.

#Consumo e prezzo: dati non misurati qui

La potenza dichiarata dal produttore non corrisponde al consumo misurato alla presa. Un confronto energetico richiede un wattmetro, lo stesso sistema, la durata e gli output prodotti. I precedenti rapporti prezzo/token e i consigli con valori numerici per il power limit sono stati rimossi per mancanza di misurazioni tracciabili. Confronta i prezzi attuali solo dopo aver definito il tuo fabbisogno di memoria.

#Scegliere in base alla memoria realmente necessaria

Una scheda da 32 GB può essere utile quando il tuo modello quantizzato e il suo contesto superano il budget di una scheda da 24 GB ma rimangono sotto il limite di 32 GB. Per modelli piccoli, verifica innanzitutto i risultati sul tuo hardware attuale. Per Scout, il peso totale rimane fondamentale: i parametri attivi non rendono questo modello compatibile con 32 GB.

#Proseguire con un'installazione gratuita

Il configuratore fornisce una stima di compatibilità. La scheda del modello e la guida a Ollama permettono poi di verificare l'installazione e la distribuzione tra CPU e GPU prima di qualsiasi acquisto. I risultati hardware pubblicati sulla pagina Benchmarks vanno letti tenendo conto del relativo protocollo e della macchina esatta utilizzata.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.