Principiante 7 minOllama

Ollama: cos'è e come funziona (guida per principianti)

Che cos'è Ollama? È lo strumento più semplice per eseguire un LLM in locale sul tuo computer — senza cloud, senza abbonamento, senza inviare una sola riga a OpenAI. Questa guida spiega da zero che cos'è Ollama, come scarica ed esegue i modelli, i tre o quattro comandi che userai il 90% del tempo e il minimo indispensabile per iniziare.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Che cos'è Ollama?

Ollama è uno strumento open source che scarica, archivia ed esegue modelli linguistici (LLM) direttamente sul tuo computer. Digiti un comando, il modello si carica in memoria e puoi conversare con lui, dalla riga di comando oppure tramite un'interfaccia grafica che colleghi a Ollama. Tutto avviene localmente: nessun dato viene inviato su Internet una volta scaricato il modello.

In pratica, Ollama svolge due ruoli contemporaneamente: è un demone (un programma che gira in background) e una CLI (un comando da riga di comando) che comunica con quel demone. Il demone ascolta sulla porta 11434 del tuo computer ed espone una piccola API HTTP, la stessa di OpenAI, o quasi. Tutte le interfacce compatibili (Open WebUI, LM Studio in modalità client, Continue.dev, ecc.) possono quindi connettersi senza modifiche.

i
In una frase
Ollama = un demone locale che sa scaricare e eseguire modelli LLM open-weight, e una CLI per parlarci. Dietro, c'è llama.cpp ben pacchettizzato. Non avrai bisogno di compilare né di manipolare manualmente file GGUF.

Perché così tanti passano a Ollama? Perché elimina tutte le difficoltà tecniche dei LLM locali: nessuna compilazione, nessuna configurazione manuale della GPU, nessuna gestione delle versioni di Python. Lo installi, digiti ollama run qwen3.5:9b e funziona. È l'equivalente di Docker per i LLM: il modello e il suo ambiente di esecuzione vengono impacchettati in un formato unico.

#Come funziona internamente

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Quando lanci Ollama, tre strati collaborano. Capire questi strati cambia radicalmente la tua capacità di diagnosticare un problema.

Il demone (ollama serve)
Un servizio che funziona in background, ascolta su http://localhost:11434 e gestisce il caricamento dei modelli in memoria e la loro rimozione dalla memoria. Su Windows e macOS, si avvia automaticamente dopo l'installazione. Su Linux, è tipicamente un servizio systemd.
Il motore di inferenza (llama.cpp)
È lui a far funzionare i modelli. Ollama include una versione precompilata con supporto CUDA (NVIDIA), Metal (Apple Silicon) e CPU. Non devi compilare nulla.
CLI (ollama)
Il programma che chiami dalla riga di comando. Non fa molto da solo: invia richieste HTTP al demone e mostra le risposte.

Quando digiti ollama run qwen3.5:9b, ecco cosa succede davvero: la CLI chiede al demone di caricare questo modello; se il modello non è sul disco, il demone lo scarica dal registro di Ollama (un po' come Docker Hub); lo carica in VRAM se hai una GPU compatibile, altrimenti in RAM; e apre una sessione di chat interattiva. Tutto il lavoro pesante avviene nel demone — la CLI è solo un client.

→
La porta 11434
È la porta HTTP che tutti usano. Se un'app afferma di "connettersi al tuo Ollama", comunica con http://localhost:11434. Se Ollama è avviato e apri questo URL in un browser, vedrai il messaggio Ollama is running. È il controllo di funzionamento più semplice.

#I comandi: run, pull, list

Tre comandi coprono il 90% dell'uso. Imparali, il resto sembrerà ovvio.

#ollama run

Il comando da conoscere per primo. Scarica il modello se non è già presente, lo carica in memoria e poi apre una conversazione interattiva nel terminale.

Terminale
ollama run qwen3.5:9b
# Première fois : télécharge ~6.6 Go puis lance le chat
# Fois suivantes : charge le modèle déjà présent et démarre

Una volta nella sessione, scrivi la tua domanda e premi Invio. Per uscire, digita /bye o premi Ctrl+D. Per passare alla modalità su più righe, inizia con tre virgolette ("""). Tutto ciò che inizia con / è un comando interno (/show, /set, /clear, /save, /load).

Puoi anche passare direttamente un prompt come argomento — utile per scriptare:

Prompt one-shot
ollama run qwen3.5:9b "Résume ce texte en 3 points : [...]"

#ollama pull

Scarica un modello senza avviarlo. Utile quando vuoi preparare diversi modelli in anticipo o scaricare una variante precisa (dimensione, quantizzazione).

Terminale
ollama pull granite4.2:3b
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

Il nome segue il formato modele:tag. Senza tag, ottieni la versione predefinita (generalmente un 8B/9B in quantizzazione Q4_K_M). Con un tag esplicito, scegli la dimensione (2b, 4b, 9b, 27b, 30b) e la quantizzazione (q4_K_M, q5_K_M, q8_0, fp16).

i
Quantizzazione, in due parole
Un modello 'bruto' pesa 14 GB per 7 miliardi di parametri in FP16. La quantizzazione comprime questi numeri su meno bit: Q4_K_M (4 bit) riduce la dimensione per circa 4 volte con una perdita di qualità minima. È il punto ottimale consigliato per iniziare. Q5_K_M è un po' migliore in qualità, Q8_0 quasi perfetto ma 2 volte più pesante, FP16 riservato ai GPU potenti.

#ollama list

Mostra i modelli installati sul tuo computer, la loro dimensione su disco e la data di installazione.

Terminale
ollama list
# NAME               ID            SIZE    MODIFIED
# qwen3.5:9b         42182419e950  6.6 GB  2 days ago
# granite4.2:8b      f974a74358d6  5.3 GB  1 week ago

#Gli altri comandi utili

ollama ps
Mostra i modelli attualmente caricati in memoria (e quanta VRAM/RAM consumano). Indispensabile per diagnosticare un problema del tipo «va lento».
ollama rm <modele>
Elimina un modello dal disco. Utile quando la cartella dei modelli comincia a pesare 50 GB.
ollama show <modele>
Mostra i metadati di un modello: dimensione del contesto, quantizzazione, template del prompt, capacità (strumenti, visione, ecc.).
ollama serve
Avvia manualmente il demone in primo piano. Utile su Linux o per la diagnosi dei problemi (vedi i log in tempo reale).
ollama create
Crea un modello personalizzato a partire da un Modelfile — è l'equivalente di un Dockerfile per LLM. Argomento più avanzato.

#Dove sono memorizzati i modelli

I modelli possono pesare diversi gigabyte. Sapere dove si trovano è fondamentale per fare pulizia, spostare la libreria su un altro disco o eseguire un backup.

Windows
%USERPROFILE%\.ollama\models — tipicamente C:\Users\votrenom\.ollama\models
macOS
~/.ollama/models
Linux (installazione tramite script ufficiale)
/usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
Linux (installazione manuale a livello utente)
~/.ollama/models

All'interno di questo cartella, due sottocartelle: blobs (i file binari dei modelli, identificati da un hash) e manifests (le metadati che descrivono quale blob corrisponde a quale tag). Non modificare questi file a mano — usa ollama rm et ollama pull pour per gestirli.

→
Spostare i modelli su un altro disco
Se il tuo SSD di sistema è piccolo e hai un disco secondario più grande, imposta la variabile d'ambiente OLLAMA_MODELS per puntare altrove. Esempio: OLLAMA_MODELS=D:\ollama-models su Windows, o export OLLAMA_MODELS=/mnt/data/ollama-models su Linux. Riavvia il demone perché la variabile venga considerata.

#Configurazione minima per iniziare

La domanda «Che cos'è Ollama e il mio computer può eseguirlo?» ricorre continuamente. Ecco le soglie reali, non i requisiti minimi pubblicizzati dal marketing.

8 GB di RAM, nessuna GPU
Limitato ai modelli da 2 a 3B in Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 token al secondo su CPU moderna. Utilizzabile per testare e apprendere.
RAM 16 GB, nessun GPU
I modelli 8B rientrano in memoria in Q4 (Granite 4.2 8B, Qwen 3.5 9B). Aspettati 4–8 token al secondo. È lento per un uso interattivo continuo, ma funziona.
GPU con 8 GB di VRAM
Gestisce agevolmente i modelli 8B in Q4 (Qwen 3.5 9B, Granite 4.2 8B — 30–50 token/s). Raggiunge il limite con i modelli 12-14B.
GPU con 12 GB di VRAM (RTX 3060, 4070)
Il punto di equilibrio ideale per la fascia d'ingresso nel 2026. Tutti i modelli 8B girano in modo fluido, Gemma 4 12B in Q4 gira senza difficoltà, oppure Qwen 3.5 9B in Q8 per la massima qualità della fascia.
GPU da 16 GB (RTX 4080, 5080) o Mac M-Pro da 32 GB unificati
Si passa ai 24B in Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) o a Qwen 3.5 9B in Q8 per la qualità.
GPU 24 GB (RTX 3090, 4090) o Mac M-Max 48 GB+
Si possono eseguire comodamente modelli da 27–35B (Qwen 3.8 27B, Qwen 3.6 35B-A3B), e anche grandi MoE in Q4 con un po' di pazienza.

Per lo spazio su disco, prevedi 10 GB per ogni modello 7B in Q4 e 30 GB per ogni modello 32B. Avere da 50 a 100 GB liberi fin dall'inizio evita di dover fare pulizia troppo presto.

!
La trappola della «GPU rilevata» ma inutilizzata
Su Windows e Linux, Ollama rileva automaticamente la GPU — a meno che i tuoi driver NVIDIA non siano troppo vecchi o tu abbia una GPU AMD senza ROCm correttamente installato. Verifica con ollama ps: se la colonna PROCESSOR indica 100% CPU anche se hai una GPU, l'accelerazione hardware non è attiva. Su macOS Apple Silicon, l'accelerazione Metal è automatica e sempre attiva.

#Primo modello consigliato

Quando scopri Ollama, il primo impulso è provare il modello più grande possibile "per vedere". È un errore: saturi la VRAM, il modello viene trasferito nella RAM di sistema, tutto rallenta e finisci per rinunciare. Inizia con un modello piccolo.

  1. 01
    Qwen 3.5 9B — la scelta predefinita ragionevole
    ollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
  2. 02
    Granite 4.2 8B — l'alternativa sobria
    ollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
  3. 03
    Qwen 3.5 4B — il piccolo modello versatile che sta guadagnando popolarità
    ollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
  4. 04
    Granite 4.2 3B — se la tua macchina è modesta
    ollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
→
Esegui ollama ps durante una conversazione
In un altro terminale, mentre chatti, esegui ollama ps. Vedrai il modello caricato, la memoria utilizzata e la ripartizione GPU/CPU. È il modo migliore per capire concretamente cosa succede.

#Consigli e insidie

Il modello viene scaricato dalla memoria dopo 5 minuti di inattività
È il valore predefinito di OLLAMA_KEEP_ALIVE. Se vuoi mantenere il modello in VRAM più a lungo, imposta OLLAMA_KEEP_ALIVE=2h (o -1 per non rimuoverlo mai dalla memoria). Al contrario, imposta 0 se vuoi liberare la VRAM non appena termina una richiesta.
Risposte troncate dopo poche frasi
Il valore predefinito del parametro num_ctx (finestra di contesto) è di 4096 token, indipendentemente da ciò che il modello supporta. Per un uso RAG o per documenti lunghi, crea un Modelfile con PARAMETER num_ctx 32768 ed esegui ollama create. Attenzione: il consumo di VRAM aumenta rapidamente.
Nessun completamento automatico nella shell
Digita ollama help per vedere tutti i comandi, ollama help <comando> per i dettagli di ciascuno. La documentazione è nella CLI.
Connessione rifiutata da un'altra macchina della rete
Per impostazione predefinita Ollama ascolta soltanto su 127.0.0.1. Per esporlo su LAN, imposta OLLAMA_HOST=0.0.0.0:11434 prima di avviare il demone. Ricorda il firewall.
Lo stesso nome di modello, diverse versioni
ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
i
Un'interfaccia grafica in 5 minuti
La CLI basta per capire, ma per l'uso quotidiano collega Open WebUI (un'interfaccia web tipo ChatGPT) o LM Studio in modalità client al demone Ollama. Questi strumenti rilevano automaticamente il server su localhost:11434 e mostrano tutti i tuoi modelli in un'interfaccia ordinata.

#Per approfondire

Hai capito che cos'è Ollama e come funziona di base. Ecco i passi successivi più naturali:

Installarlo davvero sul tuo sistema operativo
La guida Installare Ollama su Windows (o macOS, o Linux) descrive passo dopo passo l'installazione, la verifica della GPU e il primo modello in un ambiente pulito.
Scegliere la quantizzazione giusta
La guida Scegliere la quantizzazione (Q4, Q5, Q8, FP16) confronta visivamente le perdite di qualità reali e ti aiuta a valutare il compromesso tra qualità e VRAM.
Collegare una vera interfaccia grafica
La guida a Open WebUI con Ollama permette di installare in 10 minuti un'interfaccia simile a ChatGPT, multiutente e con RAG integrato, sopra il daemon di cui ora disponi.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.