◆ IA in Azienda — Implementare l'IA locale sul lavoro: RGPD, AI Act, costi · 24 € · o tutti i kit a 49 € →

Modello di costo · aggiornato nel 2026

Il costo delle API IA farà saltare il tuo budget?

I fornitori di API cloud bruciano una parte enorme dei loro ricavi. Ecco il calcolo per capire se il loro prossimo aumento dei prezzi farà esplodere anche il tuo budget.

coût_mensuel_2026 = R × (T_in × P_in + (T_out + T_raisonnement) × P_out)
coût_mensuel_2027 = coût_mensuel_2026 × (1 + r)^Δmois

Calcola la mia spesa per le API e il punto di pareggio

Inserisci il tuo volume mensile: lo strumento calcola l'importo della fattura oggi, tra 12 e 24 mesi in base allo scenario di aumento, e il tempo necessario per recuperare il costo di una configurazione locale.

L'aumento nascosto che nessuno annuncia

I prezzi indicati per token sono in generale diminuiti dal 2023. Ma dietro le quinte sono cambiate due cose: i i token di ragionamento vengono fatturati come token di output, e possono rappresentare più volte la lunghezza della risposta visibile; il routing predefinito indirizza silenziosamente le richieste «difficili» verso modelli di ragionamento più costosi. Una rassegna pubblicata da TechAhead nell'aprile 2026 rileva così prezzi delle API OpenAI «fino a 4× più elevati in alcune regioni » tra marzo 2025 e gennaio 2026, nonostante le riduzioni dei prezzi di listino.

Una fattura realistica nel 2026

Carico di lavoroToken visibili/richiestaToken di ragionamento/richiestaCosto/richiesta (GPT-5)
Classificatore per l'assistenza clienti120 in / 40 out1800,0021 €
Agente di revisione del codice (1 file)2 400 in / 600 out4 8000,050 €
Agente di ricerca a più fasi8.000 in / 1.200 out22 0000,213 €
RAG giuridico con contesto lungo62.000 in / 1.500 out9 0000,161 €

Calcolo al prezzo pubblico di GPT-5 (1,25 $ per milione di token di ingresso, 10 $ di uscita, ragionamento fatturato come uscita), convertito a 0,88 € per 1 $ (settembre 2026).

Con 50.000 esecuzioni dell'agente al mese — un deployment modesto per un'azienda di medie dimensioni — la sola voce «agente di ricerca» raggiunge circa 10.600 €/mese.

Punto di pareggio rispetto all'implementazione locale

La vera domanda non è «un modello locale eguaglia su MMLU un modello di frontiera accessibile tramite API?» ma «può gestire il 70% del mio traffico in modo accettabile e quanto costa la migrazione?». Tre deployment di riferimento, ammortizzati su 24 mesi, elettricità inclusa (0,20 €/kWh, 60% di utilizzo). La soglia confronta questo costo mensile con il solo prezzo dei token di output di GPT-5 (≈ 8,80 € per milione di token):

ConfigurazioneModelloCosto hardwareCosto mensileRedditizio già da
RTX 5090 32 GB (aggiunta a un PC esistente)Qwen 3 32B Q4_K_M≈ 5 000 €≈ 265 €~30 milioni di token di output/mese
2 × RTX 5090 (senza NVLink, modello distribuito)Qwen 2.5 72B Q4_K_M≈ 10 000 €≈ 520 €~59M token in uscita/mese
Mac Studio M5 Ultra 96 GBgpt-oss 120B≈ 6 600 €≈ 300 €~34M token di output/mese

Prezzi hardware rilevati a settembre 2026 (RTX 5090 tra ≈ 5 000 e 5 600 € a seconda del venditore, Mac Studio M5 Ultra 96 GB a 6 599 €). Le RTX 5090 non hanno NVLink: due schede condividono il modello tramite il bus PCIe.

Per l'esempio sopra (50.000 esecuzioni, ~1,16 miliardi di token di output e di ragionamento al mese, ≈ 10.600 €/mese), il punto di pareggio è ampiamente superato. Ma una sola GPU non basta a produrre questo volume: servono più schede che elaborano le richieste in batch (vLLM), e parte del traffico rimarrà sull'API.

Il router ibrido: il meglio dei due mondi

Se il 70% delle richieste viene elaborato in locale, la spesa per le API diminuisce di circa il 70%, al netto del costo dell'hardware — a condizione che la qualità rimanga accettabile per queste richieste, cosa da verificare con un test sul tuo traffico.

Verdetto

Spesa API mensile attualeRaccomandazionePerché
< 400 €Restare sull'APIIl costo del lavoro di migrazione supera il risparmio ottenuto in 24 mesi
400 - 1 800 €Ottimizzare i prompt, porre un limite al ragionamentoCache del prompt, elaborazione batch (-50 %) e sforzo di ragionamento limitato riducono la fattura senza lasciare l'API
1 800 - 8 000 €Ibrido: livello 1 locale + livello 3 APIUna GPU di fascia alta si ripaga in pochi mesi se la maggior parte del traffico viene gestita localmente
> 8 000 €Migrare in modo aggressivoLa traiettoria dei costi non è più sostenibile oltre i 12 mesi

Domande frequenti

I prezzi delle API aumenteranno davvero o continueranno a diminuire?

I prezzi di lista per token sono complessivamente diminuiti dal 2023. Ma il costo per risposta utile può aumentare, perché i token di ragionamento vengono fatturati come token di output. Un'analisi pubblicata da TechAhead ad aprile 2026 rileva prezzi delle API OpenAI «fino a 4 volte più elevati in alcune regioni» tra marzo 2025 e gennaio 2026. Pianifica il budget in base al costo misurato per richiesta, non al solo prezzo di lista.

Una sola GPU di fascia alta (32 GB) basta a sostituire un'API di un modello di frontiera?

Per una buona parte del traffico abituale (codice, classificazione, RAG con meno di 32K di contesto), spesso sì: un modello 32B quantizzato in Q4_K_M gira a diverse decine di token/s su una RTX 5090. La quota realmente sostituibile dipende dalle tue attività e va verificata sul tuo traffico. Per il ragionamento più avanzato e i contesti molto lunghi, resta necessario un router ibrido che passi a un'API di frontiera.

Qual è il tasso di inflazione da usare nel modello?

Non esiste un dato ufficiale: r è un'ipotesi di scenario. A titolo di esempio, r = 0,06 al mese raddoppia la fattura in un anno. Prova anche r = 0 (prezzi stabili) e un valore negativo, che corrisponde alla diminuzione dei prezzi di listino osservata dal 2023.

Il fine-tuning è un'alternativa al passaggio all'esecuzione locale?

Il fine-tuning presso un fornitore cloud riduce il costo per token del modello adattato, ma spesso aumenta la spesa totale perché i team usano questo costo unitario più basso per giustificare più chiamate. Crea anche una dipendenza dal fornitore. Il fine-tuning LoRA di un modello locale (Qwen3 o Llama) permette risparmi duraturi.

Altri strumenti gratuiti