Principiante 3 minOllama

Installare Ollama su Windows 11: guida completa (2026)

Risposta diretta

Su Windows 11, Ollama si installa tramite un normale programma di installazione scaricato dal sito ufficiale, con rilevamento automatico della GPU (supporto nativo per CUDA NVIDIA). Un solo comando da terminale (ollama run qwen3.5:4b) scarica e avvia un primo modello in circa 5 minuti, senza configurazione manuale né comandi complessi.

Hai un PC Windows e vuoi far girare un LLM in locale senza passare per ChatGPT. Ollama è probabilmente lo strumento più semplice per riuscirci: un programma di installazione classico, un comando, un modello. In 3 minuti esatti, Qwen 3.5 è in esecuzione sul tuo computer.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows 11

#Perché Ollama?

Ollama gestisce per te tutto ciò che è fastidioso: il download dei modelli, la quantizzazione, il caricamento in VRAM, il rilevamento della GPU, l'API HTTP locale. Dietro c'è llama.cpp. Ma non dovrai compilarlo.

Lo strumento è gratuito, open source e funziona completamente offline una volta scaricato il modello. Nessun dato viene inviato a un server remoto.

i
In due parole
Ollama = un daemon locale che funziona in background + una CLI per parlare con lui. I modelli vivono in una cartella sul tuo disco. È tutto.

#Prerequisiti

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Windows 10 o 11
64 bit. Ollama non ha una versione a 32 bit.
Almeno 8 GB di RAM
16 GB consentono di usare comodamente modelli da 8 a 9B con quantizzazione Q4.
10 GB di spazio disco
Un modello da 4 a 9B pesa circa da 3 a 7 GB. Prevedi spazio in abbondanza se intendi testarne diversi.
GPU NVIDIA (opzionale)
Driver aggiornati, RTX 20/30/40/50 o GTX 16. Ollama rileva automaticamente la GPU.
→
Funziona anche senza GPU
Una CPU moderna esegue un piccolo modello (da 2 a 4B, come Qwen 3.5 2B o Granite 4.2 3B) a 5–10 token al secondo. È lento, ma utilizzabile per fare delle prove. Per un uso quotidiano, punta a una GPU con almeno 6 GB di VRAM.

#1. Download

Visita il sito ufficiale e scarica il programma di installazione per Windows.

Link ufficiale
https://ollama.com/download/windows

L'installatore occupa circa 700 MB. È normale: contiene i binari precompilati llama.cpp con supporto CUDA.

!
Verifica il dominio
Scarica Ollama soltanto da ollama.com. Le versioni redistribuite su GitHub da terzi possono contenere malware. Lo strumento è open source — se sei paranoico, compilalo dal repository ufficiale.

#2. Installazione

  1. 01
    Avvia OllamaSetup.exe
    Fai doppio clic sull'installatore scaricato. Windows Defender può mostrare un avviso SmartScreen — clicca su "Informazioni aggiuntive" poi su "Esegui comunque".
  2. 02
    Installazione silente
    Nessuna finestra di configurazione: l'installer si installa in %LOCALAPPDATA%\Programs\Ollama e avvia automaticamente il servizio in background.
  3. 03
    Verifica l'icona del sistema
    Un'icona piccola di Ollama appare accanto all'orologio, in basso a destra. Indica che il daemon è in esecuzione.
  4. 04
    Apri un terminale
    PowerShell, Windows Terminal o cmd.exe — non importa. Digita il comando di verifica qui sotto.
PowerShell
ollama --version

Dovresti vedere qualcosa come ollama version is 0.5.x. Se il comando non è riconosciuto, chiudi e riapri il terminale — il PATH è stato appena modificato.

#3. Il tuo primo modello

Qwen 3.5 4B è una buona prima scelta: multilingue (con un ottimo francese), leggero, molto veloce e di eccellente qualità per le sue dimensioni. Con licenza Apache 2.0.

Scaricare e avviare
ollama run qwen3.5:4b

La prima volta, Ollama scarica il modello (circa 3,4 GB in Q4). Le volte successive, il lancio è istantaneo. Quando appare il prompt >>>, puoi iniziare a parlare.

Prova di conversazione
>>> Bonjour, présente-toi en 2 phrases.

Je suis Qwen 3.5, un modèle de langage open-source développé par l'équipe Qwen (Alibaba).
Je fonctionne entièrement en local sur votre machine, sans connexion internet.
→
Abbandonare la conversazione
Digita /bye o premi Ctrl+D per uscire. Il modello rimane caricato in memoria per alcuni minuti, rendendo istantanei i successivi avvii.

#4. Verificare che la GPU sia utilizzata

Per impostazione predefinita, Ollama rileva la tua GPU NVIDIA e vi carica il modello. Per confermarlo, esegui questo comando mentre una conversazione è in corso:

Stato del modello caricato
ollama ps

Nella colonna PROCESSOR, dovresti vedere 100% GPU. Se vedi CPU o una percentuale parziale, significa che il modello viene caricato in parte nella RAM di sistema.

i
VRAM insufficiente?
Qwen 3.5 4B Q4 ha bisogno di circa 3,4 GB di VRAM. Se la tua GPU ha davvero poca memoria disponibile, passa a un modello ancora più leggero: Granite 4.2 3B (ollama run granite4.2:3b, 2,2 GB) o Qwen 3.5 2B (ollama run qwen3.5:2b, 1,9 GB).

Per monitorare in tempo reale l'uso della GPU, apri un'altra finestra di PowerShell:

Monitoring
nvidia-smi -l 1

#5. Un'interfaccia pulita con Open WebUI

Il terminale va bene per fare prove. Per l'uso quotidiano, Open WebUI assomiglia a ChatGPT: cronologia, markdown, allegati, c'è tutto. Il metodo più semplice passa attraverso Docker Desktop.

Avviare Open WebUI
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Apri quindi http://localhost:3000 nel tuo browser. Crea un account (è locale, nulla esce dalla tua macchina), e i tuoi modelli Ollama appaiono nella lista.

#Risoluzione dei problemi

"ollama: comando non trovato"
Il PATH non è stato ricaricato. Chiudi e riapri tutti i tuoi terminali. In ultima istanza, riavvia la sessione Windows.
Download bloccato allo 0%
Un firewall aziendale a volte blocca Ollama. Prova da un'altra rete o configura un proxy tramite la variabile HTTPS_PROXY.
Il modello funziona ma è lento
Controlla ollama ps. Se indica 100% CPU, la tua GPU è troppo piccola oppure viene rilevata in modo errato. Aggiorna i driver NVIDIA.
Risposte tagliate dopo poche righe
La finestra di contesto predefinita è di 2048 token. Aumentala con /set parameter num_ctx 8192 nella conversazione.

#Per approfondire

Ollama è in esecuzione. I prossimi passi logici:

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.