Principiante 8 minOllama

Ollama Cloud: prezzi, recensioni e limiti (2026)

Ollama Cloud propone una cosa semplice: eseguire sui server di Ollama modelli troppo grandi per la tua macchina — 120B, 480B, 671B parametri — con la stessa CLI della versione locale. È pratico. Ma questo cambia due cose fondamentali: i tuoi prompt lasciano il tuo computer e paghi in base all'utilizzo. Questa guida spiega esattamente di cosa si tratta, quanto costa e perché, nella maggior parte dei casi, il self-hosting resta preferibile.

Di Mohamed Meguedmi·Agg. 2026-09-05·Testato su Windows, macOS e Linux
i
In breve
Ollama Cloud esegue sui server di Ollama modelli troppo grandi per la tua macchina (120B, 480B, 671B), con la stessa CLI usata in locale. · L'offerta spazia da un abbonamento mensile con una quota di ore a una fatturazione in base alla durata dell'inferenza per gli utilizzi intensivi — verifica le tariffe su ollama.com/cloud, perché cambiano. · A differenza dell'esecuzione locale, i tuoi prompt lasciano la tua macchina e transitano attraverso server situati prevalentemente negli Stati Uniti. · Per un utilizzo ricorrente o per dati sensibili, l'hosting autonomo resta di gran lunga preferibile.

#Cos'è Ollama Cloud

Dal 2025, Ollama propone un'offerta a pagamento chiamata Ollama Cloud che permette di chiamare modelli ospitati sulla sua infrastruttura GPU, mantenendo esattamente gli stessi comandi usati per un modello locale. La promessa: eseguire modelli open-weight enormi (centinaia di miliardi di parametri) senza aver bisogno di un Mac Studio Ultra o di un cluster H100.

In pratica, installi Ollama come al solito, ti autentichi e scarichi un modello contrassegnato "cloud" (ad esempio gpt-oss:120b-cloud). L'inferenza non avviene più sulla tua GPU, ma sui server di Ollama: la tua macchina invia soltanto i token del prompt e riceve i token di risposta.

Esempio di chiamata cloud (sintassi generale)
# Authentification (une seule fois)
ollama signin

# Lancer un modèle hébergé
ollama run gpt-oss:120b-cloud
i
Non è un "cloud locale"
Ollama Cloud non è un modo ibrido che esegue parte del modello sul tuo dispositivo. È semplice inferenza remota: i tuoi prompt vanno su Internet, come con l'API di OpenAI o Anthropic. L'unico elemento "locale" è la CLI.

#Quali modelli girano in cloud

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Il catalogo cloud punta proprio sui modelli che girano con difficoltà in locale. Si evolve, ma la logica rimane la stessa: modelli open-weight o aperti, di dimensioni molto grandi, oppure multimodali con requisiti elevati di VRAM.

Modelli con 100 miliardi di parametri o più
Come gpt-oss:120b, qwen3-coder:480b, kimi-k2 — che richiedono da 60 a 250 GB di VRAM in Q4, fuori dalla portata di una singola workstation.
Modelli di frontiera MoE
DeepSeek V3/V4, Llama 4 Maverick: le versioni complete, non le distillazioni 7B/32B che si installano localmente.
Modelli specializzati pesanti
Modelli giganti per il coding, modelli di ragionamento ("thinking") con contesto lungo, modelli di visione ad alta risoluzione.

I modelli "normali" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, ecc.) restano consigliati in locale: rientrano nella memoria di una RTX 3060 da 12 GB o di un MacBook Air, e non c'è alcun vantaggio a trasferirne l'esecuzione nel cloud.

#Prezzi e limiti

Ollama Cloud si colloca tra un abbonamento mensile a tariffa fissa (con una quota di richieste/ora) e un modello di fatturazione a consumo per gli usi intensivi. I prezzi esatti cambiano — verifica su ollama.com/cloud prima di impegnarti — ma alcune costanti meritano di essere segnalate.

Quote orarie
I piani base limitano il numero di richieste per ora o per giorno. Questi limiti sono adeguati per una persona che usa la chat, ma vengono raggiunti rapidamente da uno script che elabora in ciclo 10.000 documenti.
Fatturazione in base alla durata dell'inferenza
I modelli molto grandi vengono talvolta fatturati in base al tempo di utilizzo della GPU. Una richiesta con un contesto lungo (32k token, ragionamento profondo) costa necessariamente più di un «ciao».
Nessun prezzo per token mostrato per impostazione predefinita
A differenza di OpenAI o Anthropic, su Ollama Cloud l'API non fattura sistematicamente per token. Ciò rende la pianificazione del budget meno precisa.
Nessun SLA per l'utenza consumer
L'offerta è nuova, non esiste (al momento di scrivere queste righe) una garanzia di disponibilità comparabile a quella dei grandi cloud.
!
La trappola del "quasi gratuito"
Una quota gratuita o un piano base economico invoglia a far passare tutto dal cloud. Ma appena si automatizza (elaborazione batch, agente che esegue un ciclo, RAG su 100.000 chunk), la fattura aumenta rapidamente e la latenza di rete si aggiunge a ogni chiamata.

#Confidenzialità: cosa cambia veramente

È qui che la differenza rispetto al self-hosting diventa strutturale, non marginale. Quando usi Ollama in locale, i tuoi prompt non escono mai dalla porta 11434 su localhost — puoi verificarlo con il firewall. Nel cloud, transitano su Internet e vengono elaborati su un'infrastruttura di terzi.

I tuoi prompt escono dal perimetro
Qualsiasi dato inviato — estratto di contratto, codice sorgente proprietario, cartella clinica di un paziente, email — lascia la tua macchina. Per uno studio legale, un medico, un servizio di risorse umane o un laboratorio di ricerca e sviluppo, è inaccettabile.
Politica di conservazione
Ollama dichiara di non addestrare i propri modelli sui tuoi prompt. Tuttavia, la conservazione per il debug, il rilevamento degli abusi o i log varia a seconda dei piani. Leggi le condizioni generali d'uso prima di inviare dati sensibili.
GDPR e hosting
I server Ollama Cloud si trovano prevalentemente negli Stati Uniti. Per i dati personali europei, questo solleva questioni relative ai trasferimenti al di fuori dell'UE che l'hosting autonomo elimina in un colpo solo.
Impossibile effettuare un audit dell'infrastruttura
In locale, puoi usare tcpdump per monitorare la porta 11434 e dimostrare che non esce alcun dato. Con il cloud, devi fidarti: non c’è un metodo tecnico per verificare cosa viene registrato.
→
Test di tcpdump
Per un'istanza di Ollama self-hosted, esegui `sudo tcpdump -i any port 443` mentre utilizzi il modello. Non deve apparire alcun pacchetto in uscita. Con Ollama Cloud, vedrai traffico verso i server ollama.com. La prova della riservatezza è binaria e osservabile.

#Alternative self-hosted per ogni modello cloud

Per la quasi totalità dei modelli offerti nel cloud, esiste un'alternativa locale equivalente (un modello più piccolo della stessa famiglia) oppure accettabile (un altro modello open-weight comparabile). Ecco le corrispondenze utili.

gpt-oss:120b-cloud → llama3.1:8b o qwen2.5:14b localmente
Per il 90% degli usi conversazionali, un 8B-14B Q4 su una RTX 3060 12 GB basta. La differenza si nota soprattutto in compiti di ragionamento lungo o di conoscenza enciclopedica.
qwen3-coder:480b-cloud → qwen2.5-coder:14b o 32b
Il modello 32B in Q4 (≈19 GB di VRAM) funziona su una RTX 4090 o su un Mac M-Max. Per l'autocompletamento del codice in un IDE, è ampiamente sufficiente — vedere la guida su Continue.dev.
deepseek-v3:671b-cloud → deepseek-r1:32b o 70b distillato
Le versioni distillate di DeepSeek R1 riproducono l'80-90 % del ragionamento del modello completo sui benchmark standard, in locale su una 4090 o un Mac Studio.
Modelli di visione giganti → qwen2.5-vl:7b o llama3.2-vision:11b
Per l'OCR, il tagging delle immagini e la descrizione, questi due modelli funzionano con 8-12 GB di VRAM. Vedi la guida agli LLM multimodali con capacità visive in locale.
Contesto lungo 1M token → modelli locali 128k + chunking
Pochissimi usi reali richiedono 1M di token in una sola volta. Una buona pipeline RAG con chunking + reranker gestisce corpus enormi con un modello locale da 32k.
i
La differenza di qualità si riduce ogni trimestre
Un modello 14B del 2026 supera un 70B del 2024 sulla maggior parte dei benchmark. Il ragionamento "mi serve un 400B" diventa sempre più raro. Prima di pagare per il cloud, verifica davvero se un 14B locale non sia sufficiente — spesso resterai sorpreso.

#Tabella decisionale

Per decidere tra Ollama Cloud e self-host, poniti queste cinque domande nell'ordine indicato. La prima la cui risposta è "self-host" risolve la questione.

1. I dati sono sensibili?
Codice proprietario, dati dei clienti, sanità, ambito legale, risorse umane, R&D → self-hosting, punto e basta.
2. Sei soggetto al RGPD o a una normativa settoriale?
Ospedale, banca, settore pubblico, dati europei → self-host, o cloud sovrano dedicato (non Ollama Cloud)
3. Il volume è prevedibile e elevato?
Più di qualche migliaio di chiamate al giorno → una GPU da 1500 € si ammortizza in pochi mesi rispetto a una fattura cloud variabile.
4. Hai bisogno di poter lavorare offline?
Sede senza una connessione affidabile, demo sul campo, conformità ai requisiti di isolamento air-gap → self-hosting obbligatorio.
5. Hai assolutamente bisogno di un modello da 100B in su?
Se sì, e solo se sì, e dopo aver provato un 32B locale: Ollama Cloud diventa un'opzione da considerare.
→
Regola pratica
Se hai dubbi, inizia in locale con un modello 14B Q4. Capirai presto se i suoi limiti ostacolano davvero il tuo utilizzo: nell'80% dei casi, no. Il cloud rimane l'eccezione, non la regola.

#Quando usare l'uno, quando usare l'altro

#I pochi casi in cui Ollama Cloud è una buona scelta

Valutazione una tantum di un modello gigantesco
Vuoi verificare in 10 minuti se un modello da 480B per la programmazione vale la pena prima di investire in una macchina — il cloud evita l'acquisto impulsivo.
Demo per un cliente senza hardware sul posto
Un commerciale che mostra un POC sul suo laptop senza portarsi dietro un Mac Studio.
Singola attività molto impegnativa
Un rapporto di 500 pagine da riassumere una volta ogni trimestre, con contesto lungo e nessun dato confidenziale all'interno.
Apprendimento ed esplorazione
Scoprire cosa un modello da 670B sa fare, per poi tornare al locale sapendo cosa cercare.

#I casi in cui il self-hosting è vantaggioso

Qualsiasi utilizzo ripetuto
Assistente di programmazione per l'uso quotidiano, chat interna del team, RAG sui documenti aziendali — la stabilità della fattura conta.
Qualsiasi utilizzo su dati sensibili
Non si discute: ambito legale, salute, risorse umane, finanza, R&D e codice proprietario restano in locale.
Tutti gli usi automatizzati
Pipeline batch, agenti che eseguono cicli, n8n, script ETL: le quote cloud esplodono, i costi diventano imprevedibili.
Qualsiasi utilizzo offline o edge
Raspberry Pi in laboratorio, laptop in viaggio, sede senza una connessione Internet affidabile.
Qualsiasi esigenza di personalizzazione
Fine-tuning, Modelfile personalizzato, prompt di sistema del team, integrazione profonda con i tuoi strumenti — il cloud non lo permette.
!
La trappola del lock-in
Una volta che un team ha preso l'abitudine di chiamare uno specifico modello cloud, abbandonarlo è doloroso: prompt calibrati, formati di output, comportamenti particolari. Investire fin dall'inizio nell'hosting autonomo evita questa dipendenza — e permette di risparmiare quando i prezzi salgono.

#Per approfondire

Se concludi che il self-hosting è la strada giusta per il tuo caso (il che è probabile), queste guide ti aiutano a partire con il piede giusto:

Scegliere la GPU giusta
La guida Scegliere una GPU per l'IA locale approfondisce i compromessi tra VRAM, budget e prestazioni, dalla RTX 3060 da 12 GB al Mac Studio Ultra.
Capire la quantizzazione
La guida Scegliere la quantizzazione (Q4, Q5, Q8, FP16) spiega come far stare un modello da 32B su una GPU da 16 GB senza degradare la qualità.
Riservatezza operativa
La Checklist di privacy elenca le verifiche concrete per assicurarsi che nessun pacchetto esca dalla tua macchina — la prova con i fatti.
Domande frequenti su Ollama Cloud
Ollama Cloud è gratuito?+
Esiste un piano gratuito, ma con limiti d'uso ridotti (pochi modelli simultanei, quote che si rinnovano per sessione e per settimana). Per un uso più intensivo, Ollama offre piani a pagamento con abbonamento mensile che danno accesso a più modelli simultanei e a quote maggiori. I prezzi esatti cambiano: controlla sempre la pagina ufficiale ollama.com/pricing prima di impegnarti, anziché fidarti di una cifra fissa.
Come usare Ollama senza passare per il cloud?+
Non cambia nulla: l'installazione locale classica di Ollama funziona esattamente come prima, senza account né abbonamento. Il cloud è una funzionalità opzionale che si attiva solo quando scegli esplicitamente un modello contrassegnato "cloud" e ti autentichi. Finché usi modelli standard (Llama, Mistral, Qwen, ecc.), tutto viene eseguito in locale, senza bisogno di una connessione dopo il download del modello.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.