Come installare Ollama: guida completa (Windows, Mac, Linux)
Stai cercando di eseguire modelli LLM open-source in locale? Imparare come installare ollama è il primo passo per democratizzare l'accesso ai pesi aperti sulla tua macchina. Questo strumento semplifica notevolmente il download e l'esecuzione di diversi modelli, che tu usi Windows, macOS o Linux. Questa guida completa descrive in dettaglio ogni metodo di installazione per consentirti di iniziare a sperimentare con architetture potenti come DeepSeek V4 Pro 1.6T o MiMo V2.5 Pro. Esploreremo i passaggi tecnici, le prestazioni e come sfruttare questa piattaforma locale.
Che cos'è Ollama e perché usarlo per i LLM locali?
Ollama è uno strumento progettato per semplificare il deployment di grandi modelli linguistici (LLM) in ambienti personali o su server locali. Invece di gestire manualmente le dipendenze complesse, i framework di quantizzazione come llama.cpp, e le configurazioni specifiche per ogni modello, Ollama fornisce un'interfaccia CLI semplice. Funziona come un server locale che permette di interagire con diversi LLM attraverso un'API standardizzata.
Per chi vuole andare oltre nell'esperimentazione locale, è utile sapere che strumenti come llama.cpp (GitHub ufficiale) sono spesso la base sotto il cofano di Ollama. Se desideri provare un modello performante come DeepSeek V4 Flash 0731 304B o esplorare le capacità di Kimi K2.5, Ollama rende l'accesso a questi pesi più diretto.
Il vantaggio principale risiede nella semplicità: basta un comando per scaricare e avviare un modello, il che è ideale per gli utenti che vogliono passare rapidamente dal concetto all'esecuzione locale sul proprio PC o Mac. Se vuoi confrontare diverse architetture prima di scegliere la tua installazione, il nostro catalogo elenca centinaia di modelli con le rispettive specifiche di VRAM e licenze. Puoi consultare i lavori di DeepSeek su Hugging Face per vedere l'ampia gamma delle loro creazioni disponibili localmente.
Guida dettagliata di installazione per ogni sistema operativo
Il processo varia leggermente in base al tuo sistema operativo, ma il principio rimane lo stesso: installare l'eseguibile Ollama e poi usare la riga di comando per scaricare i modelli.
Installazione su macOS (Mac)
Per gli utenti Mac, sia con chip della serie M sia con macchine Intel, l'installazione è particolarmente semplice. Puoi scaricare lo script di installazione ufficiale da Ollama (GitHub ufficiale). Una volta installato, Ollama si avvia in background e sei pronto a interagire con i modelli tramite il tuo terminale. Per configurazioni specifiche su Mac, in particolare per ottimizzare l'uso della GPU Apple Silicon, consulta la nostra guida llm-mac-mini-m4.
Installazione su Windows
Su Windows, hai due opzioni principali: usare il binario nativo o passare attraverso WSL2 (Windows Subsystem for Linux 2). Se scegli l'installazione nativa, segui le istruzioni del sito ufficiale. Per un'integrazione più robusta e una migliore compatibilità con gli strumenti di sviluppo basati su Linux, spesso consigliamo di usare WSL2. Il nostro manuale ollama-wsl2-vs-windows-natif descrive in dettaglio questo approccio.
Installazione su Linux
L'installazione su Linux è generalmente la più semplice tramite uno script del repository o un binario precompilato, seguendo le istruzioni fornite da Ollama (GitHub ufficiale). Per una documentazione passo passo dedicata ai comandi shell, consulta il nostro tutorial specifico: installer-ollama-linux.
Eseguire e testare i tuoi primi modelli LLM con Ollama
Una volta installato Ollama, utilizzi il comando ollama run <nom_du_modele> per iniziare. È qui che scegli il cervello della tua sessione locale.
Ad esempio, se vuoi provare un modello molto performante come DeepSeek V4 Pro 0813 1.7T, eseguirai il comando corrispondente. È importante notare che i modelli sono spesso offerti in diverse versioni (quantizzazioni) per bilanciare dimensioni e prestazioni. Ad esempio, modelli come GLM 5.2 753B-A40B richiederanno una configurazione hardware di notevole potenza.
Per valutare la potenza bruta, puoi consultare il Open LLM Leaderboard (Hugging Face). Se il tuo obiettivo è creare un ambiente completo per lo sviluppo di agenti, abbiamo preparato tutorial sull'integrazione con CrewAI o sugli agenti locali crewai-ollama-multi-agents.
Esempi di modelli da testare: * Per un'abilità di ragionamento avanzata, prova Inkling (975B) o DeepSeek V4 Pro 1.6T (1600B). Puoi anche esaminare le capacità di Kimi K3. * Se ti interessa il codice, Kimi K2.7 Code è un buon punto di partenza per testare modelli specializzati in programmazione. * Per modelli più leggeri e veloci in locale, guarda le varianti come Mixtral 8x22B Instruct.
Ottimizzazione e utilizzo avanzato di Ollama
L'uso di modelli LLM locali non si limita alla semplice conversazione nel terminale. Ollama può essere integrato in workflow più complessi. Se desideri un'interfaccia grafica intuitiva, ti consigliamo di esplorare strumenti come Open WebUI (GitHub ufficiale), che si integra perfettamente con il server Ollama.
Per gli utenti avanzati che desiderano automatizzare attività o sviluppare applicazioni, è possibile configurare chiamate API dirette alla tua istanza Ollama. La nostra guida appel-outil-ollama-tutoriel ti mostra come integrare questi LLM in script Python.
Se riscontri problemi di prestazioni, soprattutto legati all'uso della GPU (accelerazione GPU), consulta la nostra guida depanner-ollama-gpu-erreurs. Per un confronto diretto tra Ollama e altre soluzioni come LM Studio, trovi un comparativo nelle nostre guide interfaces-graphiques-ollama-comparatif. Se cerchi alternative più specifiche, la nostra pagina alternatives-ollama-tour-horizon è una risorsa utile.
FAQ: Domande frequenti sull'installazione di Ollama
Q: Qual è il requisito hardware minimo per iniziare con Ollama?
R: Per test di base, un sistema moderno basta. Tuttavia, se desideri eseguire modelli più grandi come GLM 5.3 Flash 320B-A18B (che richiede circa 186 GB in Q4), è necessaria una scheda grafica con molta VRAM. Per configurazioni modeste, privilegia i modelli quantizzati o utilizza la CPU solo se hai pazienza durante le inferenze.
Q: Come scegliere un modello dopo aver installato Ollama?
R: La scelta dipende dal tuo uso (chat, codice, ragionamento) e dalle tue risorse hardware. Se la velocità è fondamentale, considera le versioni "Flash" come DeepSeek V4 Flash 284B. Per una qualità massima su compiti complessi, esplora modelli più grandi come Kimi K3 o DeepSeek V4 Pro 0813 1.7T, verificando sempre le loro specifiche sul nostro catalogo.
Q: Ollama funziona esclusivamente con modelli GGUF?
R: Sebbene Ollama utilizzi ampiamente il formato GGUF (ottimizzato per l'inferenza su CPU/GPU tramite llama.cpp), supporta anche altri formati e può interagire con pesi provenienti da diverse fonti, basandosi sulle convenzioni definite dalla comunità open-source LLM Hugging Face Hub (documentazione).
Q: Posso usare Ollama per fare RAG?
R: Sì, assolutamente. Sebbene Ollama sia il motore di inferenza, devi integrarlo in un framework RAG (Retrieval Augmented Generation) come LangChain o LlamaIndex. Abbiamo tutorial specifici su questo argomento, ad esempio anythingllm-rag-tutoriel-complet.
Q: Ollama è gratuito e open-source?
R: Lo strumento stesso, Ollama, è progettato per essere accessibile e facile da usare. I modelli che esegue sono per la maggior parte rilasciati con licenze aperte (MIT, Apache 2.0) o secondo le politiche di apertura dei fornitori come Moonshot AI su Hugging Face, il che garantisce un utilizzo libero in locale per la sperimentazione.
Conclusione: il tuo punto di accesso ai LLM locali
In sintesi, come installare Ollama è un processo semplice ma potente che apre l'accesso a modelli di punta sulla tua infrastruttura. Che tu sia un principiante o un esperto che cerca di integrare sistemi complessi come quelli basati su Llama 3.1 405B Instruct, Ollama è la soluzione di orchestrazione ideale. Una volta completata l'installazione, esplora il nostro configuratore per trovare il modello perfetto adatto al tuo hardware e alle tue esigenze specifiche.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QualeLLM può percepire una commissione sugli acquisti, senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.