Ollama Cloud: prezzi, recensioni e limiti (2026)
Ollama Cloud propone una cosa semplice: eseguire sui server di Ollama modelli troppo grandi per la tua macchina — 120B, 480B, 671B parametri — con la stessa CLI della versione locale. È pratico. Ma questo cambia due cose fondamentali: i tuoi prompt lasciano il tuo computer e paghi in base all'utilizzo. Questa guida spiega esattamente di cosa si tratta, quanto costa e perché, nella maggior parte dei casi, il self-hosting resta preferibile.
#Cos'è Ollama Cloud
Dal 2025, Ollama propone un'offerta a pagamento chiamata Ollama Cloud che permette di chiamare modelli ospitati sulla sua infrastruttura GPU, mantenendo esattamente gli stessi comandi usati per un modello locale. La promessa: eseguire modelli open-weight enormi (centinaia di miliardi di parametri) senza aver bisogno di un Mac Studio Ultra o di un cluster H100.
In pratica, installi Ollama come al solito, ti autentichi e scarichi un modello contrassegnato "cloud" (ad esempio gpt-oss:120b-cloud). L'inferenza non avviene più sulla tua GPU, ma sui server di Ollama: la tua macchina invia soltanto i token del prompt e riceve i token di risposta.
#Quali modelli girano in cloud
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Il catalogo cloud punta proprio sui modelli che girano con difficoltà in locale. Si evolve, ma la logica rimane la stessa: modelli open-weight o aperti, di dimensioni molto grandi, oppure multimodali con requisiti elevati di VRAM.
- Modelli con 100 miliardi di parametri o più
- Come gpt-oss:120b, qwen3-coder:480b, kimi-k2 — che richiedono da 60 a 250 GB di VRAM in Q4, fuori dalla portata di una singola workstation.
- Modelli di frontiera MoE
- DeepSeek V3/V4, Llama 4 Maverick: le versioni complete, non le distillazioni 7B/32B che si installano localmente.
- Modelli specializzati pesanti
- Modelli giganti per il coding, modelli di ragionamento ("thinking") con contesto lungo, modelli di visione ad alta risoluzione.
I modelli "normali" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, ecc.) restano consigliati in locale: rientrano nella memoria di una RTX 3060 da 12 GB o di un MacBook Air, e non c'è alcun vantaggio a trasferirne l'esecuzione nel cloud.
#Prezzi e limiti
Ollama Cloud si colloca tra un abbonamento mensile a tariffa fissa (con una quota di richieste/ora) e un modello di fatturazione a consumo per gli usi intensivi. I prezzi esatti cambiano — verifica su ollama.com/cloud prima di impegnarti — ma alcune costanti meritano di essere segnalate.
- Quote orarie
- I piani base limitano il numero di richieste per ora o per giorno. Questi limiti sono adeguati per una persona che usa la chat, ma vengono raggiunti rapidamente da uno script che elabora in ciclo 10.000 documenti.
- Fatturazione in base alla durata dell'inferenza
- I modelli molto grandi vengono talvolta fatturati in base al tempo di utilizzo della GPU. Una richiesta con un contesto lungo (32k token, ragionamento profondo) costa necessariamente più di un «ciao».
- Nessun prezzo per token mostrato per impostazione predefinita
- A differenza di OpenAI o Anthropic, su Ollama Cloud l'API non fattura sistematicamente per token. Ciò rende la pianificazione del budget meno precisa.
- Nessun SLA per l'utenza consumer
- L'offerta è nuova, non esiste (al momento di scrivere queste righe) una garanzia di disponibilità comparabile a quella dei grandi cloud.
#Confidenzialità: cosa cambia veramente
È qui che la differenza rispetto al self-hosting diventa strutturale, non marginale. Quando usi Ollama in locale, i tuoi prompt non escono mai dalla porta 11434 su localhost — puoi verificarlo con il firewall. Nel cloud, transitano su Internet e vengono elaborati su un'infrastruttura di terzi.
- I tuoi prompt escono dal perimetro
- Qualsiasi dato inviato — estratto di contratto, codice sorgente proprietario, cartella clinica di un paziente, email — lascia la tua macchina. Per uno studio legale, un medico, un servizio di risorse umane o un laboratorio di ricerca e sviluppo, è inaccettabile.
- Politica di conservazione
- Ollama dichiara di non addestrare i propri modelli sui tuoi prompt. Tuttavia, la conservazione per il debug, il rilevamento degli abusi o i log varia a seconda dei piani. Leggi le condizioni generali d'uso prima di inviare dati sensibili.
- GDPR e hosting
- I server Ollama Cloud si trovano prevalentemente negli Stati Uniti. Per i dati personali europei, questo solleva questioni relative ai trasferimenti al di fuori dell'UE che l'hosting autonomo elimina in un colpo solo.
- Impossibile effettuare un audit dell'infrastruttura
- In locale, puoi usare tcpdump per monitorare la porta 11434 e dimostrare che non esce alcun dato. Con il cloud, devi fidarti: non c’è un metodo tecnico per verificare cosa viene registrato.
#Alternative self-hosted per ogni modello cloud
Per la quasi totalità dei modelli offerti nel cloud, esiste un'alternativa locale equivalente (un modello più piccolo della stessa famiglia) oppure accettabile (un altro modello open-weight comparabile). Ecco le corrispondenze utili.
- gpt-oss:120b-cloud → llama3.1:8b o qwen2.5:14b localmente
- Per il 90% degli usi conversazionali, un 8B-14B Q4 su una RTX 3060 12 GB basta. La differenza si nota soprattutto in compiti di ragionamento lungo o di conoscenza enciclopedica.
- qwen3-coder:480b-cloud → qwen2.5-coder:14b o 32b
- Il modello 32B in Q4 (≈19 GB di VRAM) funziona su una RTX 4090 o su un Mac M-Max. Per l'autocompletamento del codice in un IDE, è ampiamente sufficiente — vedere la guida su Continue.dev.
- deepseek-v3:671b-cloud → deepseek-r1:32b o 70b distillato
- Le versioni distillate di DeepSeek R1 riproducono l'80-90 % del ragionamento del modello completo sui benchmark standard, in locale su una 4090 o un Mac Studio.
- Modelli di visione giganti → qwen2.5-vl:7b o llama3.2-vision:11b
- Per l'OCR, il tagging delle immagini e la descrizione, questi due modelli funzionano con 8-12 GB di VRAM. Vedi la guida agli LLM multimodali con capacità visive in locale.
- Contesto lungo 1M token → modelli locali 128k + chunking
- Pochissimi usi reali richiedono 1M di token in una sola volta. Una buona pipeline RAG con chunking + reranker gestisce corpus enormi con un modello locale da 32k.
#Tabella decisionale
Per decidere tra Ollama Cloud e self-host, poniti queste cinque domande nell'ordine indicato. La prima la cui risposta è "self-host" risolve la questione.
- 1. I dati sono sensibili?
- Codice proprietario, dati dei clienti, sanità, ambito legale, risorse umane, R&D → self-hosting, punto e basta.
- 2. Sei soggetto al RGPD o a una normativa settoriale?
- Ospedale, banca, settore pubblico, dati europei → self-host, o cloud sovrano dedicato (non Ollama Cloud)
- 3. Il volume è prevedibile e elevato?
- Più di qualche migliaio di chiamate al giorno → una GPU da 1500 € si ammortizza in pochi mesi rispetto a una fattura cloud variabile.
- 4. Hai bisogno di poter lavorare offline?
- Sede senza una connessione affidabile, demo sul campo, conformità ai requisiti di isolamento air-gap → self-hosting obbligatorio.
- 5. Hai assolutamente bisogno di un modello da 100B in su?
- Se sì, e solo se sì, e dopo aver provato un 32B locale: Ollama Cloud diventa un'opzione da considerare.
#Quando usare l'uno, quando usare l'altro
#I pochi casi in cui Ollama Cloud è una buona scelta
- Valutazione una tantum di un modello gigantesco
- Vuoi verificare in 10 minuti se un modello da 480B per la programmazione vale la pena prima di investire in una macchina — il cloud evita l'acquisto impulsivo.
- Demo per un cliente senza hardware sul posto
- Un commerciale che mostra un POC sul suo laptop senza portarsi dietro un Mac Studio.
- Singola attività molto impegnativa
- Un rapporto di 500 pagine da riassumere una volta ogni trimestre, con contesto lungo e nessun dato confidenziale all'interno.
- Apprendimento ed esplorazione
- Scoprire cosa un modello da 670B sa fare, per poi tornare al locale sapendo cosa cercare.
#I casi in cui il self-hosting è vantaggioso
- Qualsiasi utilizzo ripetuto
- Assistente di programmazione per l'uso quotidiano, chat interna del team, RAG sui documenti aziendali — la stabilità della fattura conta.
- Qualsiasi utilizzo su dati sensibili
- Non si discute: ambito legale, salute, risorse umane, finanza, R&D e codice proprietario restano in locale.
- Tutti gli usi automatizzati
- Pipeline batch, agenti che eseguono cicli, n8n, script ETL: le quote cloud esplodono, i costi diventano imprevedibili.
- Qualsiasi utilizzo offline o edge
- Raspberry Pi in laboratorio, laptop in viaggio, sede senza una connessione Internet affidabile.
- Qualsiasi esigenza di personalizzazione
- Fine-tuning, Modelfile personalizzato, prompt di sistema del team, integrazione profonda con i tuoi strumenti — il cloud non lo permette.
#Per approfondire
Se concludi che il self-hosting è la strada giusta per il tuo caso (il che è probabile), queste guide ti aiutano a partire con il piede giusto:
- Scegliere la GPU giusta
- La guida Scegliere una GPU per l'IA locale approfondisce i compromessi tra VRAM, budget e prestazioni, dalla RTX 3060 da 12 GB al Mac Studio Ultra.
- Capire la quantizzazione
- La guida Scegliere la quantizzazione (Q4, Q5, Q8, FP16) spiega come far stare un modello da 32B su una GPU da 16 GB senza degradare la qualità.
- Riservatezza operativa
- La Checklist di privacy elenca le verifiche concrete per assicurarsi che nessun pacchetto esca dalla tua macchina — la prova con i fatti.
Ollama Cloud è gratuito?+
Come usare Ollama senza passare per il cloud?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.