Ollama: cos'è e come funziona (guida per principianti)
Che cos'è Ollama? È lo strumento più semplice per eseguire un LLM in locale sul tuo computer — senza cloud, senza abbonamento, senza inviare una sola riga a OpenAI. Questa guida spiega da zero che cos'è Ollama, come scarica ed esegue i modelli, i tre o quattro comandi che userai il 90% del tempo e il minimo indispensabile per iniziare.
#Che cos'è Ollama?
Ollama è uno strumento open source che scarica, archivia ed esegue modelli linguistici (LLM) direttamente sul tuo computer. Digiti un comando, il modello si carica in memoria e puoi conversare con lui, dalla riga di comando oppure tramite un'interfaccia grafica che colleghi a Ollama. Tutto avviene localmente: nessun dato viene inviato su Internet una volta scaricato il modello.
In pratica, Ollama svolge due ruoli contemporaneamente: è un demone (un programma che gira in background) e una CLI (un comando da riga di comando) che comunica con quel demone. Il demone ascolta sulla porta 11434 del tuo computer ed espone una piccola API HTTP, la stessa di OpenAI, o quasi. Tutte le interfacce compatibili (Open WebUI, LM Studio in modalità client, Continue.dev, ecc.) possono quindi connettersi senza modifiche.
Perché così tanti passano a Ollama? Perché elimina tutte le difficoltà tecniche dei LLM locali: nessuna compilazione, nessuna configurazione manuale della GPU, nessuna gestione delle versioni di Python. Lo installi, digiti ollama run qwen3.5:9b e funziona. È l'equivalente di Docker per i LLM: il modello e il suo ambiente di esecuzione vengono impacchettati in un formato unico.
#Come funziona internamente
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Quando lanci Ollama, tre strati collaborano. Capire questi strati cambia radicalmente la tua capacità di diagnosticare un problema.
- Il demone (ollama serve)
- Un servizio che funziona in background, ascolta su http://localhost:11434 e gestisce il caricamento dei modelli in memoria e la loro rimozione dalla memoria. Su Windows e macOS, si avvia automaticamente dopo l'installazione. Su Linux, è tipicamente un servizio systemd.
- Il motore di inferenza (llama.cpp)
- È lui a far funzionare i modelli. Ollama include una versione precompilata con supporto CUDA (NVIDIA), Metal (Apple Silicon) e CPU. Non devi compilare nulla.
- CLI (ollama)
- Il programma che chiami dalla riga di comando. Non fa molto da solo: invia richieste HTTP al demone e mostra le risposte.
Quando digiti ollama run qwen3.5:9b, ecco cosa succede davvero: la CLI chiede al demone di caricare questo modello; se il modello non è sul disco, il demone lo scarica dal registro di Ollama (un po' come Docker Hub); lo carica in VRAM se hai una GPU compatibile, altrimenti in RAM; e apre una sessione di chat interattiva. Tutto il lavoro pesante avviene nel demone — la CLI è solo un client.
#I comandi: run, pull, list
Tre comandi coprono il 90% dell'uso. Imparali, il resto sembrerà ovvio.
#ollama run
Il comando da conoscere per primo. Scarica il modello se non è già presente, lo carica in memoria e poi apre una conversazione interattiva nel terminale.
Una volta nella sessione, scrivi la tua domanda e premi Invio. Per uscire, digita /bye o premi Ctrl+D. Per passare alla modalità su più righe, inizia con tre virgolette ("""). Tutto ciò che inizia con / è un comando interno (/show, /set, /clear, /save, /load).
Puoi anche passare direttamente un prompt come argomento — utile per scriptare:
#ollama pull
Scarica un modello senza avviarlo. Utile quando vuoi preparare diversi modelli in anticipo o scaricare una variante precisa (dimensione, quantizzazione).
Il nome segue il formato modele:tag. Senza tag, ottieni la versione predefinita (generalmente un 8B/9B in quantizzazione Q4_K_M). Con un tag esplicito, scegli la dimensione (2b, 4b, 9b, 27b, 30b) e la quantizzazione (q4_K_M, q5_K_M, q8_0, fp16).
#ollama list
Mostra i modelli installati sul tuo computer, la loro dimensione su disco e la data di installazione.
#Gli altri comandi utili
- ollama ps
- Mostra i modelli attualmente caricati in memoria (e quanta VRAM/RAM consumano). Indispensabile per diagnosticare un problema del tipo «va lento».
- ollama rm <modele>
- Elimina un modello dal disco. Utile quando la cartella dei modelli comincia a pesare 50 GB.
- ollama show <modele>
- Mostra i metadati di un modello: dimensione del contesto, quantizzazione, template del prompt, capacità (strumenti, visione, ecc.).
- ollama serve
- Avvia manualmente il demone in primo piano. Utile su Linux o per la diagnosi dei problemi (vedi i log in tempo reale).
- ollama create
- Crea un modello personalizzato a partire da un Modelfile — è l'equivalente di un Dockerfile per LLM. Argomento più avanzato.
#Dove sono memorizzati i modelli
I modelli possono pesare diversi gigabyte. Sapere dove si trovano è fondamentale per fare pulizia, spostare la libreria su un altro disco o eseguire un backup.
- Windows
- %USERPROFILE%\.ollama\models — tipicamente C:\Users\votrenom\.ollama\models
- macOS
- ~/.ollama/models
- Linux (installazione tramite script ufficiale)
- /usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
- Linux (installazione manuale a livello utente)
- ~/.ollama/models
All'interno di questo cartella, due sottocartelle: blobs (i file binari dei modelli, identificati da un hash) e manifests (le metadati che descrivono quale blob corrisponde a quale tag). Non modificare questi file a mano — usa ollama rm et ollama pull pour per gestirli.
#Configurazione minima per iniziare
La domanda «Che cos'è Ollama e il mio computer può eseguirlo?» ricorre continuamente. Ecco le soglie reali, non i requisiti minimi pubblicizzati dal marketing.
- 8 GB di RAM, nessuna GPU
- Limitato ai modelli da 2 a 3B in Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 token al secondo su CPU moderna. Utilizzabile per testare e apprendere.
- RAM 16 GB, nessun GPU
- I modelli 8B rientrano in memoria in Q4 (Granite 4.2 8B, Qwen 3.5 9B). Aspettati 4–8 token al secondo. È lento per un uso interattivo continuo, ma funziona.
- GPU con 8 GB di VRAM
- Gestisce agevolmente i modelli 8B in Q4 (Qwen 3.5 9B, Granite 4.2 8B — 30–50 token/s). Raggiunge il limite con i modelli 12-14B.
- GPU con 12 GB di VRAM (RTX 3060, 4070)
- Il punto di equilibrio ideale per la fascia d'ingresso nel 2026. Tutti i modelli 8B girano in modo fluido, Gemma 4 12B in Q4 gira senza difficoltà, oppure Qwen 3.5 9B in Q8 per la massima qualità della fascia.
- GPU da 16 GB (RTX 4080, 5080) o Mac M-Pro da 32 GB unificati
- Si passa ai 24B in Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) o a Qwen 3.5 9B in Q8 per la qualità.
- GPU 24 GB (RTX 3090, 4090) o Mac M-Max 48 GB+
- Si possono eseguire comodamente modelli da 27–35B (Qwen 3.8 27B, Qwen 3.6 35B-A3B), e anche grandi MoE in Q4 con un po' di pazienza.
Per lo spazio su disco, prevedi 10 GB per ogni modello 7B in Q4 e 30 GB per ogni modello 32B. Avere da 50 a 100 GB liberi fin dall'inizio evita di dover fare pulizia troppo presto.
#Primo modello consigliato
Quando scopri Ollama, il primo impulso è provare il modello più grande possibile "per vedere". È un errore: saturi la VRAM, il modello viene trasferito nella RAM di sistema, tutto rallenta e finisci per rinunciare. Inizia con un modello piccolo.
- 01Qwen 3.5 9B — la scelta predefinita ragionevoleollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
- 02Granite 4.2 8B — l'alternativa sobriaollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
- 03Qwen 3.5 4B — il piccolo modello versatile che sta guadagnando popolaritàollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
- 04Granite 4.2 3B — se la tua macchina è modestaollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
#Consigli e insidie
- Il modello viene scaricato dalla memoria dopo 5 minuti di inattività
- È il valore predefinito di OLLAMA_KEEP_ALIVE. Se vuoi mantenere il modello in VRAM più a lungo, imposta OLLAMA_KEEP_ALIVE=2h (o -1 per non rimuoverlo mai dalla memoria). Al contrario, imposta 0 se vuoi liberare la VRAM non appena termina una richiesta.
- Risposte troncate dopo poche frasi
- Il valore predefinito del parametro num_ctx (finestra di contesto) è di 4096 token, indipendentemente da ciò che il modello supporta. Per un uso RAG o per documenti lunghi, crea un Modelfile con PARAMETER num_ctx 32768 ed esegui ollama create. Attenzione: il consumo di VRAM aumenta rapidamente.
- Nessun completamento automatico nella shell
- Digita ollama help per vedere tutti i comandi, ollama help <comando> per i dettagli di ciascuno. La documentazione è nella CLI.
- Connessione rifiutata da un'altra macchina della rete
- Per impostazione predefinita Ollama ascolta soltanto su 127.0.0.1. Per esporlo su LAN, imposta OLLAMA_HOST=0.0.0.0:11434 prima di avviare il demone. Ricorda il firewall.
- Lo stesso nome di modello, diverse versioni
- ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
#Per approfondire
Hai capito che cos'è Ollama e come funziona di base. Ecco i passi successivi più naturali:
- Installarlo davvero sul tuo sistema operativo
- La guida Installare Ollama su Windows (o macOS, o Linux) descrive passo dopo passo l'installazione, la verifica della GPU e il primo modello in un ambiente pulito.
- Scegliere la quantizzazione giusta
- La guida Scegliere la quantizzazione (Q4, Q5, Q8, FP16) confronta visivamente le perdite di qualità reali e ti aiuta a valutare il compromesso tra qualità e VRAM.
- Collegare una vera interfaccia grafica
- La guida a Open WebUI con Ollama permette di installare in 10 minuti un'interfaccia simile a ChatGPT, multiutente e con RAG integrato, sopra il daemon di cui ora disponi.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.