Installare Ollama su Windows 11: guida completa (2026)
Su Windows 11, Ollama si installa tramite un normale programma di installazione scaricato dal sito ufficiale, con rilevamento automatico della GPU (supporto nativo per CUDA NVIDIA). Un solo comando da terminale (ollama run qwen3.5:4b) scarica e avvia un primo modello in circa 5 minuti, senza configurazione manuale né comandi complessi.
Hai un PC Windows e vuoi far girare un LLM in locale senza passare per ChatGPT. Ollama è probabilmente lo strumento più semplice per riuscirci: un programma di installazione classico, un comando, un modello. In 3 minuti esatti, Qwen 3.5 è in esecuzione sul tuo computer.
#Perché Ollama?
Ollama gestisce per te tutto ciò che è fastidioso: il download dei modelli, la quantizzazione, il caricamento in VRAM, il rilevamento della GPU, l'API HTTP locale. Dietro c'è llama.cpp. Ma non dovrai compilarlo.
Lo strumento è gratuito, open source e funziona completamente offline una volta scaricato il modello. Nessun dato viene inviato a un server remoto.
#Prerequisiti
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Windows 10 o 11
- 64 bit. Ollama non ha una versione a 32 bit.
- Almeno 8 GB di RAM
- 16 GB consentono di usare comodamente modelli da 8 a 9B con quantizzazione Q4.
- 10 GB di spazio disco
- Un modello da 4 a 9B pesa circa da 3 a 7 GB. Prevedi spazio in abbondanza se intendi testarne diversi.
- GPU NVIDIA (opzionale)
- Driver aggiornati, RTX 20/30/40/50 o GTX 16. Ollama rileva automaticamente la GPU.
#1. Download
Visita il sito ufficiale e scarica il programma di installazione per Windows.
L'installatore occupa circa 700 MB. È normale: contiene i binari precompilati llama.cpp con supporto CUDA.
#2. Installazione
- 01Avvia OllamaSetup.exeFai doppio clic sull'installatore scaricato. Windows Defender può mostrare un avviso SmartScreen — clicca su "Informazioni aggiuntive" poi su "Esegui comunque".
- 02Installazione silenteNessuna finestra di configurazione: l'installer si installa in %LOCALAPPDATA%\Programs\Ollama e avvia automaticamente il servizio in background.
- 03Verifica l'icona del sistemaUn'icona piccola di Ollama appare accanto all'orologio, in basso a destra. Indica che il daemon è in esecuzione.
- 04Apri un terminalePowerShell, Windows Terminal o cmd.exe — non importa. Digita il comando di verifica qui sotto.
Dovresti vedere qualcosa come ollama version is 0.5.x. Se il comando non è riconosciuto, chiudi e riapri il terminale — il PATH è stato appena modificato.
#3. Il tuo primo modello
Qwen 3.5 4B è una buona prima scelta: multilingue (con un ottimo francese), leggero, molto veloce e di eccellente qualità per le sue dimensioni. Con licenza Apache 2.0.
La prima volta, Ollama scarica il modello (circa 3,4 GB in Q4). Le volte successive, il lancio è istantaneo. Quando appare il prompt >>>, puoi iniziare a parlare.
#4. Verificare che la GPU sia utilizzata
Per impostazione predefinita, Ollama rileva la tua GPU NVIDIA e vi carica il modello. Per confermarlo, esegui questo comando mentre una conversazione è in corso:
Nella colonna PROCESSOR, dovresti vedere 100% GPU. Se vedi CPU o una percentuale parziale, significa che il modello viene caricato in parte nella RAM di sistema.
Per monitorare in tempo reale l'uso della GPU, apri un'altra finestra di PowerShell:
#5. Un'interfaccia pulita con Open WebUI
Il terminale va bene per fare prove. Per l'uso quotidiano, Open WebUI assomiglia a ChatGPT: cronologia, markdown, allegati, c'è tutto. Il metodo più semplice passa attraverso Docker Desktop.
Apri quindi http://localhost:3000 nel tuo browser. Crea un account (è locale, nulla esce dalla tua macchina), e i tuoi modelli Ollama appaiono nella lista.
#Risoluzione dei problemi
- "ollama: comando non trovato"
- Il PATH non è stato ricaricato. Chiudi e riapri tutti i tuoi terminali. In ultima istanza, riavvia la sessione Windows.
- Download bloccato allo 0%
- Un firewall aziendale a volte blocca Ollama. Prova da un'altra rete o configura un proxy tramite la variabile HTTPS_PROXY.
- Il modello funziona ma è lento
- Controlla ollama ps. Se indica 100% CPU, la tua GPU è troppo piccola oppure viene rilevata in modo errato. Aggiorna i driver NVIDIA.
- Risposte tagliate dopo poche righe
- La finestra di contesto predefinita è di 2048 token. Aumentala con /set parameter num_ctx 8192 nella conversazione.
#Per approfondire
Ollama è in esecuzione. I prossimi passi logici:
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.