Intermedio 11 minImmagine

Generare immagini localmente: Ollama, Stable Diffusione

La ricerca «ollama image generation» ricorre continuamente, e la risposta si riassume in una frase: Ollama non genera immagini, ma mette a disposizione modelli di testo e di visione. Generare immagini in locale, senza cloud né abbonamento, è però del tutto possibile, con altri strumenti. Questa guida fa il punto, sulla base di verifiche, su ciò che Ollama sa e non sa fare, poi elenca le opzioni reali (Stable Diffusion, ComfyUI, Draw Things su Mac), la VRAM effettivamente necessaria, l'installazione più semplice in base al tuo sistema e cosa aspettarsi in termini di qualità rispetto a Midjourney o DALL-E.

Di Mohamed Meguedmi·Agg. 2026-09-08·Testato su Windows, macOS e Linux

#Ollama e l'immagine: cosa sa e cosa non sa fare

Cominciamo chiarendo l'equivoco più comune dietro la ricerca « ollama image generation ». Ollama è un runtime per grandi modelli linguistici: scarica ed esegue modelli in formato GGUF, espone un'API compatibile con OpenAI su http://localhost:11434 e gestisce il caricamento dei modelli in memoria e la loro rimozione dalla memoria. Il suo ambito è il testo — e, con l'arrivo dei modelli multimodali, anche la lettura di immagini in ingresso.

La distinzione che conta è quella tra comprendere un'immagine e crearla. Ollama fa la prima cosa tramite modelli di visione come Qwen VL, Gemma o Llama Vision: invii una foto, il modello la descrive, ne esegue l'OCR o risponde a domande su di essa. Si tratta di generazione di testo a partire da un'immagine. La generazione di immagini — produrre un file PNG a partire da un prompt — si basa su un'architettura completamente diversa (modelli di diffusione, non transformer linguistici), che Ollama non esegue.

!
Non cercare un modello per generare immagini su ollama.com
Non esiste un « ollama run stable-diffusion ». La libreria Ollama contiene solo LLM e modelli di visione-linguistica. Ogni tutorial che afferma di generare immagini direttamente con il comando ollama run se inganna l'utente. Per creare immagini serve un motore di diffusione dedicato.

In sintesi: mantieni Ollama per il testo e l’analisi delle immagini e affiancagli uno strumento basato sulla diffusione per la creazione. I due convivono molto bene sulla stessa macchina e possono persino condividere la GPU, purché tu non li utilizzi contemporaneamente.


#Perché generare le immagini localmente

Il kit Immagini IA

La tua prima immagine è stata generata sulla tua macchina. Il kit Immagini IA ti accompagna nei passi successivi: un flusso testo→immagine che padroneggi (cap. 5), rientrare nella memoria video disponibile e andare più veloce (cap. 7), poi addestrare il tuo stile personale (cap. 11).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Generare in locale richiede un po' più di impegno rispetto ad aprire Midjourney, ma i motivi per farlo sono concreti e si sommano rapidamente non appena si supera l'uso occasionale.

Nessun costo di utilizzo
una volta predisposti l'hardware e i modelli, puoi generare tutte le immagini che vuoi senza crediti né abbonamento. Nessuna quota mensile, nessuna fatturazione per immagine.
Confidenzialità totale
I tuoi prompt e le tue immagini non escono mai dalla macchina. Decisivo per immagini di prodotti non annunciati, contenuti dei clienti soggetti a NDA o dati sensibili.
Nessuna censura dal lato del server
I filtri dei contenuti dei servizi cloud sono spesso ampi e opachi. In locale, il computer è tuo e le regole sono tue, nel quadro giuridico a cui resti soggetto.
Controllo e riproducibilità
seed fisso, impostazioni precise, modelli e LoRA selezionati: riproduci un'immagine pixel per pixel, qualcosa che i servizi cloud non garantiscono da un aggiornamento all'altro.
Offline
Una volta scaricati i modelli, tutto funziona senza connessione. Pratico in viaggio o su un computer isolato.

#Le vere opzioni locali per generare immagini

Poiché Ollama non è un'opzione per la creazione, ecco gli strumenti validi che generano davvero immagini in locale nel 2026. Tutti si basano su modelli di diffusione (famiglia Stable Diffusion, SDXL o architetture recenti come FLUX); ciò che cambia da uno strumento all'altro è l'interfaccia e il pubblico a cui si rivolge.

AUTOMATIC1111 (Stable Diffusion WebUI)
l'interfaccia web storica, ricca e documentata. Schede txt2img / img2img, estensioni in abbondanza, comunità enorme. Un po' datata, ma ancora il punto di riferimento per imparare.
ComfyUI
un'interfaccia basata su un grafo di nodi: colleghi visivamente la pipeline (modello → sampler → VAE → output). Curva di apprendimento più ripida, ma controllo totale e il miglior supporto per modelli recenti come FLUX.
Fooocus
pensato per la semplicità nello stile di Midjourney: un campo per il prompt, dei preset e lo strumento gestisce il resto. Ideale per iniziare senza capire il funzionamento interno della diffusione.
Draw Things (macOS / iOS)
applicazione nativa per Apple Silicon, gratuita, ottimizzata per Metal e la memoria unificata. Di gran lunga la soluzione più semplice su Mac: tutto è integrato, incluso il download dei modelli.
SD.Next
un fork di AUTOMATIC1111 mantenuto più attivamente, con un migliore supporto per più backend (CUDA, ROCm, Intel). Una buona alternativa se usi una GPU non NVIDIA.
→
Quale strumento per chi
Principiante su Windows/Linux → Fooocus. Su Mac → Draw Things. Vuoi imparare e sperimentare → AUTOMATIC1111. Vuoi il massimo controllo e i modelli più recenti → ComfyUI. I modelli (.safetensors) sono condivisi tra questi strumenti: nulla ti impedisce di provarne diversi.

#VRAM necessaria in base al modello di diffusione

La generazione di immagini richiede molta VRAM, ma il fabbisogno varia in modo meno lineare rispetto agli LLM: ciò che conta è il modello di diffusione scelto e la risoluzione desiderata. Ecco alcuni riferimenti realistici per generare immagini senza difficoltà nel 2026.

Stable Diffusion 1.5 — 4 GB di VRAM
Il modello più leggero. Funziona anche su una scheda grafica modesta, con immagini native a 512×512. Datato ma veloce e poco esigente in termini di hardware.
SDXL — da 8 a 12 GB di VRAM
lo standard per qualità e accessibilità. Immagini native 1024×1024, buon livello di dettaglio. Una RTX 3060 12GB è più che sufficiente, una RTX 4070 offre un buon margine.
FLUX (dev / schnell) — da 12 a 24 GB di VRAM
la generazione recente, con qualità fotorealistica e aderenza al prompt nettamente superiori. Le versioni quantizzate (GGUF, fp8) riducono l'occupazione di memoria, ma per lavorare comodamente servono comunque da 16 a 24 GB.
Mac Apple Silicon — memoria unificata
un M4 Pro con 24–48 GB condivide la memoria tra CPU e GPU: SDXL funziona senza problemi, anche FLUX con un po' di pazienza. Più lento di una RTX di fascia alta, ma silenzioso e con consumi contenuti.
i
Senza una GPU dedicata, è possibile ma lento
La generazione usando solo la CPU funziona (la modalità --use-cpu di AUTOMATIC1111, oppure Draw Things su un Mac di fascia entry-level), ma metti in conto diversi minuti per immagine contro pochi secondi su GPU. Per un uso regolare, una scheda con almeno 8 GB di VRAM cambia tutto.

#L'installazione più semplice in base al tuo sistema operativo

Il percorso più breve varia a seconda della macchina. Ecco l'opzione meno fastidiosa per ogni sistema, senza puntare all'esaustività.

#macOS (Apple Silicon): Draw Things

Su Mac, non serve usare Python né la riga di comando. Draw Things è un'app nativa scaricabile dal Mac App Store: gestisce l'installazione dei modelli, l'ottimizzazione Metal e l'interfaccia in un unico pacchetto.

  1. 01
    1. Installare l'applicazione
    Cerca «Draw Things» sul Mac App Store e installala. È gratuita.
  2. 02
    2. Scaricare un modello
    Al primo avvio, l'app propone di scaricare un modello di base (SDXL è un buon punto di partenza). Il download avviene dall'interfaccia.
  3. 03
    3. Generare
    Inserisci un prompt, lascia le impostazioni predefinite e clicca su Generate. La prima immagine viene generata in qualche decina di secondi, a seconda del chip.

#Windows / Linux con GPU NVIDIA : Fooocus o ComfyUI

Su PC con una scheda NVIDIA, Fooocus è il più rapido da mettere in funzione. Scarica il suo modello predefinito al primo avvio e non offre quasi alcuna impostazione da configurare.

Terminale — installare Fooocus
# Prérequis : Python 3.10+ et un GPU NVIDIA avec pilotes récents
git clone https://github.com/lllyasviel/Fooocus.git
cd Fooocus
python -m venv venv
source venv/bin/activate    # Windows : venv\Scripts\activate
pip install -r requirements_versions.txt
python entry_with_update.py

All'avvio, Fooocus scarica automaticamente un modello SDXL, poi apre un'interfaccia web nel browser (per default su http://127.0.0.1:7865). Tu inserisci un prompt, generi — ecco tutto.

Se preferisci il controllo tramite nodi e i modelli più recenti, ComfyUI si avvia in modo simile:

Terminale — installare ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
source venv/bin/activate
pip install -r requirements.txt
# Placez vos modèles .safetensors dans models/checkpoints/
python main.py
# Interface : http://127.0.0.1:8188
!
GPU AMD su Windows: più delicato
Il supporto ROCm su Windows rimane disomogeneo. Con una GPU AMD, privilegia Linux con ROCm oppure una variante DirectML/SD.Next su Windows. Metti in conto un po' di configurazione — vale la stessa logica che per far girare un LLM su una GPU AMD.

#I tuoi primi risultati in 30 minuti

Una volta installato lo strumento, ecco la procedura da seguire per ottenere rapidamente immagini soddisfacenti, invece di partire subito dalle impostazioni avanzate.

  1. 01
    1. Parti da un modello SDXL
    È il miglior compromesso tra qualità, VRAM e velocità per iniziare. Tieni FLUX per più avanti, quando vorrai più realismo e conoscerai i limiti della tua GPU.
  2. 02
    2. Scrivi un prompt descrittivo
    I modelli di diffusione amano le descrizioni concrete: soggetto, stile, inquadratura, luce. Ad esempio «una volpe rossa addormentata in un bosco di betulle, luce dorata del mattino, fotografia, ridotta profondità di campo».
  3. 03
    3. Lascia i parametri predefiniti
    Steps intorno a 25-30, guidance (CFG) intorno a 7 per SDXL. Non modificare nient'altro per i tuoi primi tentativi: i valori predefiniti dello strumento sono ragionevoli.
  4. 04
    4. Imposta un seed per iterare
    Lo stesso seed + un prompt leggermente modificato permette di vedere l'effetto di una parola. Il vero ciclo di lavoro è questo: cambiare un dettaglio alla volta.
  5. 05
    5. Passa a img2img per affinare
    Riprendi un'immagine generata come base e rigenera con un "denoising" parziale per correggere senza partire da zero.
→
Il prompt negativo fa la metà del lavoro
La maggior parte degli strumenti offre un campo per il prompt negativo: elenca lì ciò che non vuoi («sfocatura, mani deformate, testo, filigrana, bassa risoluzione»). Su SD 1.5 e SDXL, è spesso ciò che distingue un'immagine malriuscita da una ben riuscita.

#Qualità attesa rispetto a Midjourney e DALL-E

Siamo diretti: sulla qualità bruta «in un clic», Midjourney resta davanti. Le sue immagini sono esteticamente gradevoli di default, senza bisogno di regolazioni. DALL-E, integrato in ChatGPT, eccelle nel rispetto di un prompt complesso e nel testo all'interno dell'immagine. È il prezzo di modelli massivi addestrati e regolati da squadre dedicate, offerti dal cloud.

Ma il divario non è più quello che si immagina. FLUX in locale produce immagini fotorealistiche che rivaleggiano con Midjourney su molti soggetti, e SDXL con prompt ben formulati è più che sufficiente per la maggior parte degli utilizzi. Soprattutto, l'esecuzione locale offre vantaggi che il cloud non può offrire.

Controllo preciso
ControlNet (imporre una posa, una profondità, dei contorni), inpainting preciso, LoRA specializzati: l'esecuzione in locale offre un livello di controllo che Midjourney e DALL-E non mettono a disposizione.
Personalizzazione
migliaia di modelli e LoRA della comunità (stili, personaggi, estetiche) sono liberamente scaricabili. Adatti il modello alle tue esigenze precise.
Volume e costo
Generare mille varianti costa solo elettricità. Nel cloud, ogni variante consuma crediti.
Impegno iniziale
è il vero compromesso: Midjourney dà subito un bel risultato, mentre in locale bisogna imparare a scrivere i prompt e a regolare le impostazioni. In cambio di questo sforzo si ottengono controllo e gratuità d'uso.

Il modo giusto di inquadrare la questione: la generazione locale non sostituisce Midjourney quando vuoi ottenere una bella immagine una tantum senza doverti porre domande. Lo supera non appena hai bisogno di riservatezza, grandi volumi, riproducibilità o un controllo preciso — e la qualità dei suoi risultati migliori, con FLUX, è ormai tutt'altro che trascurabile.


#Risoluzione dei problemi comuni

« CUDA out of memory »
il modello o la risoluzione richiedono più VRAM di quella disponibile. Riduci la risoluzione, attiva la modalità « medvram » / « lowvram » dello strumento o passa a un modello più leggero (SDXL → SD 1.5, o FLUX quantizzato).
Immagini sfocate o distorte
Aumenta leggermente il numero di step, regola il CFG e soprattutto rafforza il prompt negativo. Con SDXL, verifica di generare effettivamente a 1024×1024 e non a 512.
Generazione molto lenta
Conferma che venga effettivamente utilizzata la GPU (e non la CPU per impostazione predefinita). Su NVIDIA, verifica i driver e la versione di PyTorch compilata per CUDA; normalmente se ne occupa il programma di installazione di Fooocus/ComfyUI.
Mani e volti mal riusciti
debolezza classica dei modelli di diffusione. Usa un modulo di ripristino del volto, l'inpainting sulla zona interessata, o un modello/LoRA noto per gestire meglio l'anatomia.

#Per approfondire

La generazione di immagini si integra naturalmente con il resto di uno stack di IA locale. Queste guide del sito completano ciò che hai appena messo in piedi:

Analizzare immagini piuttosto che crearle
« LLM multimodale con visione in locale: analizzare immagini con Ollama » copre l'altra metà del tema delle immagini — la lettura e l'OCR con un modello di visione.
Capire la VRAM e la scelta della GPU
Le indicazioni sulla memoria di questa guida si basano sulla stessa logica di « Scegliere la quantizzazione (Q4, Q5, Q8, FP16) », utile per dimensionare la tua scheda.
Il resto dello stack per il testo
« Installare Ollama in 5 minuti » rimane la base per la parte linguistica, da eseguire accanto al tuo motore di diffusione sulla stessa macchina.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.