Modello di costo · aggiornato nel 2026
Il costo delle API IA farà saltare il tuo budget?
I fornitori di API cloud bruciano una parte enorme dei loro ricavi. Ecco il calcolo per capire se il loro prossimo aumento dei prezzi farà esplodere anche il tuo budget.
coût_mensuel_2026 = R × (T_in × P_in + (T_out + T_raisonnement) × P_out)coût_mensuel_2027 = coût_mensuel_2026 × (1 + r)^Δmois
Calcola la mia spesa per le API e il punto di pareggio
Inserisci il tuo volume mensile: lo strumento calcola l'importo della fattura oggi, tra 12 e 24 mesi in base allo scenario di aumento, e il tempo necessario per recuperare il costo di una configurazione locale.
L'aumento nascosto che nessuno annuncia
I prezzi indicati per token sono in generale diminuiti dal 2023. Ma dietro le quinte sono cambiate due cose: i i token di ragionamento vengono fatturati come token di output, e possono rappresentare più volte la lunghezza della risposta visibile; il routing predefinito indirizza silenziosamente le richieste «difficili» verso modelli di ragionamento più costosi. Una rassegna pubblicata da TechAhead nell'aprile 2026 rileva così prezzi delle API OpenAI «fino a 4× più elevati in alcune regioni » tra marzo 2025 e gennaio 2026, nonostante le riduzioni dei prezzi di listino.
Una fattura realistica nel 2026
| Carico di lavoro | Token visibili/richiesta | Token di ragionamento/richiesta | Costo/richiesta (GPT-5) |
|---|---|---|---|
| Classificatore per l'assistenza clienti | 120 in / 40 out | 180 | 0,0021 € |
| Agente di revisione del codice (1 file) | 2 400 in / 600 out | 4 800 | 0,050 € |
| Agente di ricerca a più fasi | 8.000 in / 1.200 out | 22 000 | 0,213 € |
| RAG giuridico con contesto lungo | 62.000 in / 1.500 out | 9 000 | 0,161 € |
Calcolo al prezzo pubblico di GPT-5 (1,25 $ per milione di token di ingresso, 10 $ di uscita, ragionamento fatturato come uscita), convertito a 0,88 € per 1 $ (settembre 2026).
Con 50.000 esecuzioni dell'agente al mese — un deployment modesto per un'azienda di medie dimensioni — la sola voce «agente di ricerca» raggiunge circa 10.600 €/mese.
Punto di pareggio rispetto all'implementazione locale
La vera domanda non è «un modello locale eguaglia su MMLU un modello di frontiera accessibile tramite API?» ma «può gestire il 70% del mio traffico in modo accettabile e quanto costa la migrazione?». Tre deployment di riferimento, ammortizzati su 24 mesi, elettricità inclusa (0,20 €/kWh, 60% di utilizzo). La soglia confronta questo costo mensile con il solo prezzo dei token di output di GPT-5 (≈ 8,80 € per milione di token):
| Configurazione | Modello | Costo hardware | Costo mensile | Redditizio già da |
|---|---|---|---|---|
| RTX 5090 32 GB (aggiunta a un PC esistente) | Qwen 3 32B Q4_K_M | ≈ 5 000 € | ≈ 265 € | ~30 milioni di token di output/mese |
| 2 × RTX 5090 (senza NVLink, modello distribuito) | Qwen 2.5 72B Q4_K_M | ≈ 10 000 € | ≈ 520 € | ~59M token in uscita/mese |
| Mac Studio M5 Ultra 96 GB | gpt-oss 120B | ≈ 6 600 € | ≈ 300 € | ~34M token di output/mese |
Prezzi hardware rilevati a settembre 2026 (RTX 5090 tra ≈ 5 000 e 5 600 € a seconda del venditore, Mac Studio M5 Ultra 96 GB a 6 599 €). Le RTX 5090 non hanno NVLink: due schede condividono il modello tramite il bus PCIe.
Per l'esempio sopra (50.000 esecuzioni, ~1,16 miliardi di token di output e di ragionamento al mese, ≈ 10.600 €/mese), il punto di pareggio è ampiamente superato. Ma una sola GPU non basta a produrre questo volume: servono più schede che elaborano le richieste in batch (vLLM), e parte del traffico rimarrà sull'API.
Il router ibrido: il meglio dei due mondi
- Livello 1 (locale, 60-75 % del traffico) : classificazione, estrazione, completamento del codice, sintesi RAG con un contesto inferiore a 32K.
- Livello 2 (API di medio livello, 15-25 %) : modelli leggeri per un ragionamento moderato, a costo contenuto.
- Livello 3 (API di frontiera, 5-15%): solo le richieste che richiedono veramente un ragionamento avanzato, filtrate da un classificatore economico.
Se il 70% delle richieste viene elaborato in locale, la spesa per le API diminuisce di circa il 70%, al netto del costo dell'hardware — a condizione che la qualità rimanga accettabile per queste richieste, cosa da verificare con un test sul tuo traffico.
Verdetto
| Spesa API mensile attuale | Raccomandazione | Perché |
|---|---|---|
| < 400 € | Restare sull'API | Il costo del lavoro di migrazione supera il risparmio ottenuto in 24 mesi |
| 400 - 1 800 € | Ottimizzare i prompt, porre un limite al ragionamento | Cache del prompt, elaborazione batch (-50 %) e sforzo di ragionamento limitato riducono la fattura senza lasciare l'API |
| 1 800 - 8 000 € | Ibrido: livello 1 locale + livello 3 API | Una GPU di fascia alta si ripaga in pochi mesi se la maggior parte del traffico viene gestita localmente |
| > 8 000 € | Migrare in modo aggressivo | La traiettoria dei costi non è più sostenibile oltre i 12 mesi |
Domande frequenti
I prezzi delle API aumenteranno davvero o continueranno a diminuire?
I prezzi di lista per token sono complessivamente diminuiti dal 2023. Ma il costo per risposta utile può aumentare, perché i token di ragionamento vengono fatturati come token di output. Un'analisi pubblicata da TechAhead ad aprile 2026 rileva prezzi delle API OpenAI «fino a 4 volte più elevati in alcune regioni» tra marzo 2025 e gennaio 2026. Pianifica il budget in base al costo misurato per richiesta, non al solo prezzo di lista.
Una sola GPU di fascia alta (32 GB) basta a sostituire un'API di un modello di frontiera?
Per una buona parte del traffico abituale (codice, classificazione, RAG con meno di 32K di contesto), spesso sì: un modello 32B quantizzato in Q4_K_M gira a diverse decine di token/s su una RTX 5090. La quota realmente sostituibile dipende dalle tue attività e va verificata sul tuo traffico. Per il ragionamento più avanzato e i contesti molto lunghi, resta necessario un router ibrido che passi a un'API di frontiera.
Qual è il tasso di inflazione da usare nel modello?
Non esiste un dato ufficiale: r è un'ipotesi di scenario. A titolo di esempio, r = 0,06 al mese raddoppia la fattura in un anno. Prova anche r = 0 (prezzi stabili) e un valore negativo, che corrisponde alla diminuzione dei prezzi di listino osservata dal 2023.
Il fine-tuning è un'alternativa al passaggio all'esecuzione locale?
Il fine-tuning presso un fornitore cloud riduce il costo per token del modello adattato, ma spesso aumenta la spesa totale perché i team usano questo costo unitario più basso per giustificare più chiamate. Crea anche una dipendenza dal fornitore. Il fine-tuning LoRA di un modello locale (Qwen3 o Llama) permette risparmi duraturi.