Quanto costa un server GPU per un LLM? Acquisto, noleggio, API
Il costo di un server GPU per LLM non si riduce al prezzo di una scheda grafica. Acquistare una macchina dedicata, noleggiarla presso un fornitore di hosting o chiamare un'API cloud comporta profili di spesa radicalmente diversi: un investimento iniziale consistente contro una fattura mensile, un costo fisso contro un costo variabile. Questa guida presenta gli ordini di grandezza per il 2026, la soglia di convenienza economica del self-hosting rispetto alle API e configurazioni tipo per diverse fasce di budget.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Le 3 opzioni e i loro profili di costo
Prima di parlare di numeri, bisogna capire che il costo di un server GPU per LLM si divide in tre modelli economici molto diversi. La scelta giusta non dipende solo dal tuo budget, ma soprattutto dal tuo volume di utilizzo e dalla sensibilità dei tuoi dati.
- Acquisto (CAPEX)
- Investi una somma importante in un'unica soluzione per possedere la macchina. Il costo marginale successivo è quasi nullo (elettricità). Conviene se la utilizzi molto e a lungo.
- Noleggio (OPEX mensile)
- Un server GPU dedicato o una VM presso un fornitore di hosting, con fatturazione mensile o oraria. Nessun investimento, ma una fattura ricorrente finché la macchina è in esecuzione.
- API cloud (spese OPEX per token)
- Non gestisci nessuna macchina, paghi a consumo (per milione di token). Nessun costo fisso, ma il prezzo aumenta linearmente con l'uso.
#Acquistare una macchina dedicata
L'acquisto è il modello del self-hosting classico: una macchina a casa tua o nel tuo locale tecnico, che ammortizzi in un periodo da 2 a 4 anni. Il costo si concentra sulla GPU, che spesso rappresenta più della metà del budget totale della macchina.
- GPU di fascia base — RTX 3060 12 GB
- Circa 300 € sul mercato dell'usato. Esegue senza difficoltà modelli 7B–14B in Q4. Il costo d'ingresso per un LLM locale serio.
- GPU versatile — RTX 4070 / 4080 16 GB
- Da 700 a 1.200 €. Esecuzione fluida dei modelli 14B, modelli 32B in Q4 con un po' di margine (19 GB di VRAM sulla 4080… appena al limite).
- GPU di alto livello — RTX 4090 24 GB
- Da 1 600 a 2 000 €. Fa girare un 32B Q4 (≈19 GB) con ampio margine e un 70B con quantizzazione aggressiva. Il punto di riferimento per le workstation.
- Memoria unificata — Mac Studio / M4 Pro 48–128 GB
- Da 2.000 a 6.000 €. La VRAM unificata permette di caricare modelli da 70B, o anche più grandi, senza una configurazione multi-GPU. Silenzioso e a basso consumo elettrico.
A questo si aggiunge il resto della macchina: scheda madre, CPU, da 32 a 64 GB di RAM, un alimentatore robusto (750 W+ per una 4090) e un case ben ventilato. Metti in conto da 500 a 900 € per una buona base PC da abbinare alla GPU. Una workstation completa con GPU, in grado di eseguire modelli da 32B, costa quindi tra 2.500 e 3.500 €, tutto incluso.
#Noleggiare un server GPU da un provider
Il noleggio evita l'investimento iniziale e il problema dell'obsolescenza. Due sottocategorie: il server GPU dedicato con canone mensile (riservi la macchina in modo continuativo) e la GPU a ore in modalità cloud (paghi solo le ore di inferenza).
- GPU dedicato con noleggio mensile — provider di hosting francese
- Presso OVHcloud o Scaleway, un server con GPU dedicata si può noleggiare per un costo che va da qualche centinaio a oltre mille euro al mese, a seconda della scheda (L4, L40S, H100). Dati ospitati in Francia: un punto a favore in termini di sovranità e RGPD.
- GPU a ore — cloud spot
- Su piattaforme come RunPod, Vast.ai e Lambda, una GPU si può noleggiare da 0,20 a 3 €/h a seconda della scheda. Ideale per elaborazioni batch occasionali o per il fine-tuning, non per un uso 24/7.
- VM con GPU su cloud generalista
- AWS, GCP e Azure fatturano l’istanza GPU a ore, spesso a prezzi più alti rispetto ai fornitori specializzati, ma con l’ecosistema e lo SLA di un grande provider cloud.
Regola semplice: per un carico intermittente (qualche ora al giorno, elaborazioni in batch, sperimentazione), il noleggio a ore conviene di più. Per un servizio che deve rispondere continuamente, il noleggio mensile di una GPU dedicata o l'acquisto diventano più convenienti già dal secondo o terzo mese.
#Ricorrere a un'API cloud
L'API è l'opzione senza server: non acquisti né noleggi una GPU, paghi per ogni token consumato. È il punto di partenza più razionale quando il volume è basso o imprevedibile, perché il costo fisso è nullo.
- Modello di fatturazione
- Prezzo per milione di token di input e output. I token di output costano generalmente di più di quelli di input.
- Vantaggio
- Zero manutenzione, zero obsolescenza, accesso immediato a modelli 100B+ impossibili da eseguire su una workstation.
- Svantaggio in termini di costo
- Il prezzo cresce linearmente con l'uso. Una pipeline che elabora 100.000 documenti al giorno trasforma un'API «a basso costo» in una fattura mensile a quattro cifre.
- Svantaggio per la riservatezza
- I tuoi prompt lasciano la tua infrastruttura. Inaccettabile per dati sensibili (sanitari, legali, codice proprietario) senza un contratto e un cloud dedicato adeguato.
#Il punto di pareggio tra self-host e API
È il calcolo centrale. Una GPU acquistata è un costo fisso; un'API è un costo variabile. Esiste quindi un volume di token a partire dal quale possedere il proprio server risulta più economico rispetto al pagamento a consumo. Al di sotto di questa soglia, l'API è più vantaggiosa; al di sopra, il costo dell'hosting autonomo si ammortizza.
L'intuizione: una RTX 4090 da 1 800 € ammortizzata su 3 anni costa circa 50 €/mese di hardware, più l'elettricità. Se la tua spesa per l'API supera questo importo ogni mese, l'acquisto diventa conveniente — spesso già con qualche milione di token al giorno per un uso ricorrente. Per un uso occasionale di poche richieste al giorno, l'API resta imbattibile.
- Volume basso, dati non sensibili
- API. Il costo fisso di un server non si giustifica per qualche migliaio di token al giorno.
- Volume elevato e ricorrente
- Acquisto. Il costo della GPU si ammortizza in pochi mesi e il costo marginale per richiesta scende a quasi zero.
- Dati sensibili, qualunque sia il volume
- Self-hosting (acquisto o noleggio in Francia). La riservatezza determina la scelta prima ancora del calcolo dei costi.
- Picco occasionale o fine-tuning
- Noleggio a ore. Paghi la potenza solo durante l'operazione.
#Configurazione tipo per budget
Ecco tre profili di macchine per il self-hosting, corrispondenti a tre livelli di budget e di ambizione. Le fasce di prezzo sono ordini di grandezza per il 2026 e comprendono tutto l'hardware.
- 01Postazione di lavoro con GPU — da 2.500 a 3.500 €Una RTX 4090 da 24 GB (o una RTX 3090 usata per dimezzare il prezzo) in un PC con 64 GB di RAM. Fa girare agevolmente un 32B Q4 (≈19 GB di VRAM) e un 70B con quantizzazione aggressiva. La soluzione di riferimento per uno sviluppatore o un piccolo team.
- 02Server GPU dedicato — da 4.000 a 8.000 € o noleggio mensileUna scheda pro (L40S 48 GB, oppure 2× RTX 4090 in tensor-split) in un telaio rack, pensato per funzionare 24/7 e servire più utenti tramite Open WebUI. Acquistabile o noleggiabile presso un provider di hosting francese se non vuoi gestire l'hardware.
- 03Mini-PC con memoria unificata — da 700 a 6 000 €Un Mac mini M4 (a partire da circa 700 €) per un server di inferenza silenzioso e dai consumi contenuti, o un Mac Studio M5 Ultra (96 GB e oltre, 512 GB annunciati per fine ottobre 2026) per eseguire modelli da 70B–123B senza multi-GPU. Consumo elettrico trascurabile rispetto a una GPU NVIDIA.
#I costi nascosti da non dimenticare
Il prezzo di acquisto è solo la parte visibile. Tre voci di spesa ricorrenti vengono sistematicamente sottovalutate nel budget di un server GPU per LLM.
- Elettricità
- Una RTX 4090 consuma fino a 450 W sotto carico. Con un'inferenza quasi continua, questo comporta una spesa di diverse decine di euro al mese, a seconda della tariffa del kWh. Un Mac con memoria unificata consuma una frazione di questa energia: un vero vantaggio per il funzionamento 24/7.
- Manutenzione e disponibilità
- Un server che deve rispondere continuamente richiede supervisione, aggiornamenti e gestione dei guasti. È tempo di lavoro umano, invisibile in fattura ma concreto.
- Obsolescenza
- Una GPU perde valore e i modelli evolvono rapidamente. Ammortizzarla su 3 anni è ragionevole, ma dato che un modello 14B del 2026 supera un 70B del 2024, la corsa all'hardware non è sempre necessaria: a volte basta un modello più recente e più piccolo.
- Raffreddamento e rumore
- Una GPU di fascia alta genera calore e fa rumore. In un locale professionale, prevedere la ventilazione della stanza; su una postazione di lavoro, il comfort acustico conta.
#Per approfondire
Tre guide correlate per affinare la tua decisione: la guida alla scelta della GPU illustra i compromessi tra VRAM, budget e prestazioni scheda per scheda; il calcolatore dei costi quantifica con precisione la tua soglia di pareggio tra self-hosting e API; e la guida alla configurazione di un PC con 32 GB di VRAM elenca i componenti concreti di una macchina in grado di eseguire modelli da 32B.
- Scegliere la GPU per l'IA locale
- Guida all'acquisto 2026: RTX 4070 vs 4090 vs Mac M-Max, scelte VRAM e budget.
- Calcolatore dei costi degli LLM
- Calcola la soglia di passaggio tra self-hosting e API in base al tuo volume di token.
- Configurazione PC IA: budget di 32 GB di VRAM
- La scelta dei componenti per costruire una macchina in grado di eseguire modelli da 32B localmente.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.