Strumento 02 · Costo LLM

Calcolatore di costo LLM — API vs self-hosted

Quanto ti costa davvero ChatGPT, Claude, Gemini o DeepSeek al mese? A partire da quale volume di utilizzo una RTX 5090 o un Mac mini M5 Pro diventa conveniente dal punto di vista economico? Inserisci il tuo consumo e te lo diciamo.

Il tuo consumo mensile

Punto di riferimento: 10M di token di input + 2,5M di token di output = circa 5.000 conversazioni medie con Claude (1.500 token di input + 500 di output per conversazione). Adatta questi valori al tuo utilizzo.

Modalità avanzate

Attiva le ottimizzazioni adatte al tuo utilizzo. Non tutti i modelli supportano tutte le modalità — vedi le note nella tabella.

Costo mensile tramite API (8 fournisseurs)

Clicca sui badge per attivare/disattivare i modelli.
ModelloVendorInputOutputTotal/moisNote
Mistral Small 4★ più economicoMistral$1.5$1.52.6 €Ospitato nell'UE, prezzo basso
DeepSeek V4.1 FlashDeepSeek$3.0$3.05.3 €-50 % fuori dalle ore di punta
GPT-5 miniOpenAI$2.5$5.06.6 €Modello piccolo, buon rapporto qualità/prezzo
Gemini 3.8 FlashGoogle$7.5$9.414.8 €Flash più recente (prezzo garantito fino al 31/12/2026)
Claude Haiku 4.5Anthropic$10.0$12.519.8 €Molto veloce, multimodale
Claude Sonnet 5Anthropic$20.0$25.039.6 €Contesto 1M, migliore rapporto qualità/costo di Anthropic
Claude Opus 5.5Anthropic$40.0$50.079.2 €Contesto 1M, cache al 5% del prezzo
GPT-6 AstraOpenAI$100$125198 €Fascia alta OpenAI (settembre 2026)

Costo mensile self-hosted (4 configs)

Hardware ammortizzato su 24 mese + elettricità (0.20 €/kWh). Capacity = tok/s stimati × 4h/giorno × 30 giorni; avviso se insufficiente per 12.5M token richiesti.
HardwareVRAMAcquisto TTCAmort./moisElettricità/meseTotal/moisCapacità token/meseModelli compatibili
RTX 5070 Ti 16 GB (in un PC esistente)★ più economico16 GB1 300 €54.2 €21.1 €75.3 €19.4M
~45 tok/s
14B senza problemi, 24B in Q4 con poco margine
Mac mini M5 Pro 24 GB⚠ sottodimensionato24 GB1 999 €83.3 €2.8 €86.1 €8.6M
~20 tok/s
fino a 14B (≈ 16 GB utilizzabili su 24)
Mac Studio M5 Max 36 GB36 GB2 999 €125 €4.1 €129 €15.1M
~35 tok/s
fino ai modelli ~32B in Q4 (≈ 27 GB utilizzabili)
RTX 5090 32 GB (in un PC esistente)32 GB5 000 €208 €31.2 €240 €34.6M
~80 tok/s
fino a 32B in Q4-Q6 (nessun 70B)

Verdetto

Confronto personalizzabile — modifica le opzioni qui sotto.
API da confrontare
Mistral Small 4
2.6 €/mois
API più economica ★. Nessun hardware da acquistare, scalabilità istantanea.
Hardware da confrontare
RTX 5070 Ti 16 GB (in un PC esistente)
75.3 €/mois (amorti)
Token locali, dati privati, latenza in ms.
Punto di pareggio del self-hosting
Mai (a questo volume)
Al tuo volume attuale, Mistral Small 4 (2.6 €/mese) costa meno della sola elettricità consumata da RTX 5070 Ti 16 GB (in un PC esistente). Aumenta il consumo o cambia l'hardware/API qui sopra.
Se vuoi scrivere codice
Lo stesso calcolo, versione Copilot

Fai questo ragionamento per sostituire GitHub Copilot o Cursor? In locale, è 0 €/mese e il tuo codice non va mai nel cloud. La guida « Copilota locale per il codice » ti fornisce la configurazione completa (Ollama + Cline + Aider, configurazioni pronte) per iniziare in 30 minuti — e ti dice francamente dove l'esecuzione in locale non sostituisce il cloud.

Vedi il kit →

Locale o abbonamento ChatGPT / Claude ?

Confronta il costo dei tuoi abbonamenti con quello di una macchina locale condivisa dal team.

Abbonamenti
63.4 €
al mese, tasse incluse
Macchina locale
85.1 €
al mese per 24 mesi
Rimborsata in
32,5 mesi
risparmio in 3 anni: 217 €

Abbonamenti: prezzi pubblici rilevati il 28/09/2026 (al netto delle imposte, convertiti a 0,88 € per 1 $ e con IVA del 20% aggiunta). Macchina: prezzo di acquisto ammortizzato su 24 mesi + elettricità a 0,20 €/kWh. Un modello locale da 14B a 32B non sostituisce i modelli più potenti nei compiti difficili, né la ricerca web o la generazione di immagini incluse negli abbonamenti. Oltre pochi utenti simultanei, diventa necessaria una scheda più potente.

Quanto costa un server GPU per eseguire un LLM?

Due modi per avere il «proprio» server GPU: comprarlo o noleggiarlo a ore. Per un uso di poche ore al giorno, il noleggio costa spesso meno nel primo anno; per un uso continuo, il costo dell'acquisto si ammortizza rapidamente. E una macchina a casa tua non fa uscire alcun dato.

Acquistare: costo mensile su 24 mesi

MacchinaPrezzoAmmortamentoElettricità (4 ore al giorno)Totale/meseFino a (Q4)
RTX 5070 Ti 16 GB (PC esistente)1 300 €54 €9 €≈ 63 €14B
Mac mini M5 Pro 24 GB1 999 €83 €2 €≈ 85 €14B
Mac Studio M5 Max 36 GB2 999 €125 €3 €≈ 128 €32B
RTX 5090 32 GB (PC esistente)≈ 5 000 €208 €16 €≈ 224 €32B

Elettricità: potenza sotto carico × 4 h × 30 giorni a 0,20 €/kWh, macchina spenta per il resto del tempo. Prezzi rilevati a settembre 2026.

Noleggio: prezzo all'ora

Server a noleggioMemoria GPUPrezzo/ora4 ore al giorno24 ore su 24
Scaleway L4 (Parigi)24 GB0,79 € IVA esclusa≈ 95 €≈ 577 €
RunPod RTX 509032 GB0,61 à 0,87 €73 à 104 €443 à 636 €
RunPod A10080 GB1,05 à 1,40 €126 à 168 €764 à 1 021 €
RunPod H10080 GB1,75 à 3,07 €210 à 369 €1 278 à 2 242 €

Tariffe pubbliche rilevate il 28/09/2026 su scaleway.com e runpod.io (RunPod: intervallo tra offerta comunitaria e offerta sicura, dollari convertiti al cambio di 0,88 €). 4 ore al giorno = 120 ore al mese; 24 ore su 24 = 730 ore.

Quale scegliere?

  • Qualche ora al giorno : una RTX 5090 noleggiata costa 73–104 € al mese, meno dell'ammortamento di una scheda acquistata per circa 5.000 €.
  • In modo continuativo : una RTX 5090 noleggiata 24 ore su 24 costa da 443 a 636 € al mese; acquistata per circa 5.000 €, si ripaga in un periodo da 9 a 14 mesi, elettricità compresa (circa 95 € al mese con uso continuativo).
  • Dati sensibili : una macchina a casa tua non trasmette nulla; se la noleggi, preferisci un fornitore di hosting europeo.

Metodologia e ipotesi

Questo calcolatore fornisce un ordine di grandezza, non un preventivo contabile. Le ipotesi qui sotto sono volutamente esplicite, così puoi valutare in che modo si discostano dal tuo caso reale.

Prezzi API

  • Tariffe pubbliche rilevate il 28/09/2026 in USD/M token, fonti: developers.openai.com/api/docs/pricing, platform.claude.com/docs/en/about-claude/pricing, ai.google.dev/gemini-api/docs/pricing, api-docs.deepseek.com, mistral.ai/pricing.
  • Conversione USD→EUR al tasso 0,88 (settembre 2026, può variare ±5% in base al giorno).
  • Costo aggiuntivo per contesti lunghi (OpenAI, Gemini oltre 200k token) NON applicato — il calcolatore usa un solo prezzo per modello.
  • La tariffa della cache (prezzo ridotto specifico per ogni modello, dal 2% al 10% del prezzo dell'input) viene applicata solo se l'interruttore "Cache prompts" è attivato. Altrimenti viene ignorata.
  • Modalità batch (50% di sconto su OpenAI/Anthropic/Google/Mistral, ritardo di 24 ore) applicata solo se l'interruttore "Modalità batch" è attivato.
  • Prezzo DeepSeek fuori orario di punta (-50 %) applicato solo se l'interruttore corrispondente è attivato.

Prezzi per il self-hosting

  • Prezzo di acquisto = prezzi IVA inclusa rilevati in Francia a settembre 2026 (attiva l'opzione "IVA detraibile" per passare ai prezzi IVA esclusa, -16,67%). Le schede grafiche presuppongono un PC già esistente.
  • Potenza a riposo/sotto carico = sistema COMPLETO (PC: alimentatore+CPU+RAM+SSD+GPU; Mac: tutto in uno). Fonti: recensioni TomsHardware/AnandTech, Apple Power Analyzer, misurazioni della community di pcpartpicker.
  • Capacità in token/mese = velocità stimata in token/s × ore attive × 30 giorni. Velocità in token/s stimata su un carico di lavoro misto (un modello che entra comodamente in VRAM + un modello vicino al limite della VRAM).
  • NON conteggiato: manutenzione (~1 h/mese ≈ 30-50 € al costo equivalente di un freelance), larghezza di banda internet, puro deprezzamento dell'hardware rivenduto, difetti/RMA.
  • Attiva/disattiva "PC acceso 24h" = stato di inattività (24h - ore_attive) × potenza in inattività. Disattivato = PC spento fuori dalle ore attive (0W in inattività).

Limitazioni importanti

  • Qualità non equivalente : Llama 3.3 70B in locale ≠ GPT-5 nel ragionamento complesso / multimodale. Il punto di pareggio presuppone un'equivalenza funzionale, il che può portare a sovrastimare la redditività del self-hosting per alcuni casi d'uso.
  • Disponibilità : self-hosted richiede che il dispositivo sia acceso per elaborare le richieste. API = sempre disponibile, scalabilità istantanea.
  • Latenza : self-hosted = ms (locale); API = 200-2000 ms a seconda del fornitore + regione.
  • Dati / RGPD : self-hosted = nessun dato inviato a terzi. API statunitensi (OpenAI/Anthropic/Google) = trasferimento fuori dal territorio dell'UE. Mistral ospitato nell'UE = conforme al GDPR per impostazione predefinita.
  • Per andare oltre: Confronto modelli · configuratore GPU · catalogo di 250 LLM · Server MCP quelllm.