Qwen-Image-Edit in locale: ComfyUI e VRAM necessaria
Qwen-Image-Edit è il modello open source di editing delle immagini di Alibaba: gli fornisci una foto e un'istruzione in linguaggio naturale, e modifica l'immagine conservando il resto. Funziona in locale in ComfyUI, ma è un modello da 20 miliardi di parametri, e la domanda che blocca tutti è sempre la stessa: quale versione scaricare, FP8 o GGUF, e quanta memoria video prevedere. Questa guida segue il percorso ufficiale di ComfyUI, spiega dove leggere le dimensioni dei file e i requisiti di VRAM nelle fonti, ed elenca gli errori dei nodi che si verificano più spesso. Non tratta l'installazione di ComfyUI, descritta in una guida dedicata.
#Perché Qwen-Image-Edit e cosa comprende la famiglia
La famiglia Qwen-Image comprende due utilizzi. Qwen-Image genera un’immagine a partire da un testo, con un punto di forza riconosciuto nel suo rapporto tecnico: la resa del testo nell’immagine, comprese frasi intere e alfabeti non latini. Qwen-Image-Edit parte dallo stesso modello per modificare un’immagine esistente. Il repository GitHub QwenLM/Qwen-Image e la scheda Hugging Face Qwen/Qwen-Image-Edit distinguono due tipi di editing: l’editing semantico, che cambia il contenuto o lo stile mantenendo l’identità del soggetto, e l’editing dell’aspetto, che aggiunge, rimuove o sostituisce un elemento senza modificare il resto. Il modello sa anche correggere o sostituire un testo in un’immagine conservando il carattere tipografico e l’impaginazione.
Architettura e licenza sono i due fatti da ricordare prima di scaricare qualsiasi cosa. Il modello di diffusione è un trasformatore multimodale (MMDiT) di circa 20 miliardi di parametri. L'encoder di testo non è un piccolo CLIP: è Qwen2.5-VL 7B, un modello completo di visione e linguaggio, che legge sia la tua istruzione sia l'immagine di input. Entrambi sono pubblicati con licenza Apache 2.0, che autorizza l'uso commerciale dei pesi. Ogni componente viene scaricato separatamente, ed è proprio questa suddivisione in tre file a causare la maggior parte degli errori dei node descritti più avanti.
La linea evolutiva cambia rapidamente. La prima versione di Qwen-Image-Edit è stata pubblicata nell’agosto 2025. A settembre 2025 è seguita una versione datata 2509: accetta più immagini di input e comprende nativamente condizioni di tipo ControlNet, come una mappa di profondità, contorni o una posa. Una versione 2511 è arrivata alla fine del 2025 con una migliore coerenza del soggetto, mentre il modello di generazione ha ricevuto una revisione 2512. Nel 2026 sono state annunciate versioni 2.x. Questa guida si basa sulla linea documentata passo dopo passo da ComfyUI, dalla versione dell’agosto 2025 alla 2511: i node e l’organizzazione dei file sono gli stessi. Prima di scegliere, leggi l’inizio del README GitHub, che elenca le versioni con la relativa data di pubblicazione.
#Nativo, FP8 o GGUF: quale versione di Qwen-Image-Edit scaricare
Immagini e video IA in locale, senza limiti: ComfyUI, Flux, Z-Image, Wan 2.2 sulla tua GPU o sul tuo Mac — workflow pronti da caricare, quadro legale incluso.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Circolano tre forme dello stesso modello e non si utilizzano allo stesso modo.
- Nativo (bf16, formato Diffusers)
- Il repository Qwen/Qwen-Image-Edit su Hugging Face, suddiviso in diversi file safetensors, è pensato per la libreria Diffusers in Python. In bf16, 20 miliardi di parametri rappresentano circa 40 GB per il solo trasformatore, oltre all’encoder di testo. È la strada degli script Python e delle schede da 48 GB o più, oppure dell’offloading parziale verso la RAM. Non è la strada di ComfyUI.
- FP8 riconfezionato da Comfy Org
- Il repository Comfy-Org/Qwen-Image-Edit_ComfyUI su Hugging Face riprende i pesi in un unico file FP8 (formato e4m3fn), con l'encoder di testo e il VAE suddivisi in sottocartelle. È la versione utilizzata dai workflow ufficiali di ComfyUI. Il file del modello di diffusione pesa poco più di 20 GB. Nello stesso repository esiste una variante bf16 di circa 41 GB per le schede che hanno spazio sufficiente.
- GGUF della community
- Conversioni nel formato GGUF, il formato degli LLM quantizzati, pubblicate da contributori come city96, QuantStack o Unsloth. Scendono fino a Q8_0, Q6_K, Q5_K_M, Q4_K_M, Q3_K_M o Q2_K e richiedono l’estensione ComfyUI-GGUF. È l’opzione più realistica con meno di 16 GB di VRAM e la più comoda su Mac.
La regola di scelta è semplice. Scheda da 24 GB: FP8 ufficiale, senza pensarci. Scheda da 16 GB: FP8 funziona grazie allo spostamento della memoria di ComfyUI, ma un GGUF Q6_K o Q5_K_M evita i rallentamenti. Scheda da 12 GB: GGUF Q4_K_M o inferiore. Mac Apple Silicon: GGUF, perché ComfyUI non calcola in FP8 su Metal e dequantizza questi pesi al caricamento, raddoppiando la memoria occupata.
#VRAM necessaria: dove leggere i numeri e come interpretarli
Né il README GitHub né la scheda Hugging Face di Qwen forniscono una tabella del tipo «tanta VRAM per questa scheda». Nemmeno la documentazione di ComfyUI, per questo modello: i suoi tutorial elencano i file da scaricare, la cartella di destinazione e il workflow, e talvolta indicano l'hardware e la durata delle loro prove, da considerare come riferimento e non come promessa. Il dato affidabile, datato e verificabile è la dimensione di ogni file mostrata nella relativa pagina Hugging Face. Tutto il resto deriva da lì.
- Il modello di diffusione
- Circa 20 GB in FP8 (file qwen_image_edit_fp8_e4m3fn.safetensors del repository Comfy-Org, pubblicato nell'agosto 2025), circa 41 GB in bf16. In GGUF, il peso si calcola così: 20 miliardi di parametri moltiplicati per il numero di bit per parametro, divisi per otto. Un Q8_0 da 8,5 bit pesa circa 21 GB, un Q4_K_M da 4,5 a 5 bit circa 12 GB, un Q3_K_M circa 9-10 GB, un Q2_K circa 7 GB. La pagina di ogni repository GGUF mostra il valore esatto di ogni file.
- L'encoder di testo
- Il file qwen_2.5_vl_7b_fp8_scaled.safetensors del repository Comfy-Org pesa circa 9,4 GB. Non è necessario che rimanga nella VRAM durante il denoising: ComfyUI lo carica nella VRAM per codificare il prompt e l'immagine, poi lo scarica se lo spazio non basta. Per questo un modello da 20 GB e un encoder da 9 GB possono funzionare su una scheda da 24 GB.
- Il VAE
- Il file qwen_image_vae.safetensors pesa circa 250 MB. È trascurabile in memoria, ma indispensabile e specifico per questa famiglia: un VAE di Flux o di SDXL produce rumore colorato.
- Le attivazioni
- Il calcolo in sé richiede spazio oltre ai pesi, e ancora di più ad alta risoluzione. Il workflow ufficiale riduce l’immagine di input a circa un megapixel, limitando questa parte. Raddoppia la risoluzione di output e questo margine aumenta.
ComfyUI attiva per impostazione predefinita una gestione dinamica della VRAM, descritta nella nostra guida all’installazione: quando i pesi superano la scheda, una parte resta nella RAM e viene trasferita su richiesta. Il modello gira quindi su una scheda da 12 o 16 GB, ma ogni passaggio dall’una all’altra richiede tempo, e la RAM di sistema diventa il vero limite: con un modello da 20 GB e un encoder da 9 GB, 32 GB di RAM sono il minimo e 64 GB garantiscono comfort. La tabella di riferimento qui sotto riassume la logica, senza pretendere di fornire una misurazione.
- 24 GB e oltre (RTX 3090, 4090, 5090)
- FP8 ufficiale completo, encoder FP8, immagine di output da un megapixel senza offloading. Il bf16 da 41 GB resta riservato alle schede professionali da 48 GB.
- 16 GB (RTX 4080, 5080, 4060 Ti 16 GB)
- FP8 con offloading, oppure GGUF Q6_K fino a Q5_K_M che entrano nella scheda con l’encoder scaricato tra un passaggio e l’altro.
- 12 GB (RTX 3060 12 GB, 4070, 5070, 5070 Ti)
- GGUF Q4_K_M o Q3_K_M, encoder FP8 caricato e poi scaricato, 32 GB di RAM. Prevedi generazioni nettamente più lunghe rispetto a SDXL.
- 8 GB
- Possibile in Q2_K o Q3 con uno spostamento massiccio, al prezzo di una velocità e una qualità inferiori. Solo per modifiche occasionali.
- Mac Apple Silicon
- La memoria unificata funge da VRAM. Un GGUF Q4_K_M da 12 GB più l’encoder da 9 GB richiedono un Mac da 32 GB; 48 GB o più per lavorare senza affanni.
#Prerequisiti
- ComfyUI aggiornato
- I nodi specifici di Qwen-Image, come TextEncodeQwenImageEdit, sono arrivati in ComfyUI ad agosto 2025, mentre quelli della versione 2509 sono arrivati a settembre 2025. Un'installazione più vecchia li ignora e mostra nodi rossi. Aggiorna prima di tutto: Desktop si aggiorna da solo, l'archivio portatile tramite lo script update, l'installazione manuale con git pull.
- Una scheda NVIDIA da almeno 12 GB oppure un Mac da 32 GB
- Al di sotto, la modifica resta possibile ma diventa un esercizio di pazienza. AMD funziona su Linux con ROCm e, da gennaio 2026, su Windows con l'applicazione Desktop.
- Spazio libero sul disco
- FP8: poco più di 30 GB per il trio composto da modello, encoder e VAE. Aggiungi da 10 a 21 GB per ogni variante GGUF che provi.
- Un'installazione di ComfyUI già funzionante
- Prima immagine prodotta con SDXL o Flux. In caso contrario, inizia dalla guida all'installazione: questa guida comincia quando ComfyUI si apre su http://127.0.0.1:8188.
#Passaggi 1 e 2: scaricare i file corretti e organizzarli
Il percorso più breve è la libreria di modelli per workflow integrata in ComfyUI: menu Workflow, Sfoglia modelli, categoria Image, poi il modello Qwen-Image-Edit o la sua variante 2509 o 2511, a seconda della versione che ti interessa. ComfyUI rileva i file mancanti e propone di scaricarli direttamente nella cartella corretta. Se preferisci scaricarli manualmente, per esempio per mantenere il controllo sulla variante scelta, questa è l'organizzazione prevista, come documentato dal tutorial Qwen-Image-Edit di docs.comfy.org.
- 01Scaricare il modello di diffusioneSu Hugging Face, repository Comfy-Org/Qwen-Image-Edit_ComfyUI, cartella split_files/diffusion_models. Scegli il file FP8 corrispondente alla versione desiderata. Controlla la dimensione mostrata nella pagina prima di fare clic, poi confrontala con il file ricevuto: un download interrotto produce un file troncato e un errore illeggibile durante il caricamento.
- 02Scaricare l'encoder testuale e il VAEStesso repository, cartelle split_files/text_encoders e split_files/vae. L'encoder è comune a Qwen-Image e a tutte le versioni di Qwen-Image-Edit: ne basta un solo esemplare, anche se installi più versioni del modello. Lo stesso vale per il VAE.
- 03Sistemare ogni file nella relativa sottocartellaModello in diffusion_models, encoder in text_encoders, VAE in vae. Con ComfyUI Desktop, la cartella models si trova nel percorso scelto durante l'installazione, visibile nelle impostazioni dell'applicazione. Un file depositato in checkpoints invece che in diffusion_models non appare nel nodo di caricamento.
- 04Facoltativo: il LoRA LightningIl repository lightx2v/Qwen-Image-Lightning pubblica LoRA che riducono la generazione a 4 o 8 passaggi invece di 20, sia per Qwen-Image sia per Qwen-Image-Edit. File in models/loras. Le versioni successive del modello di editing hanno i propri LoRA Lightning: scegli quello che porta il nome della tua versione.
- 05Aggiornare ComfyUIDopo aver copiato i file, fai clic sul pulsante di aggiornamento dell'interfaccia oppure ricarica la pagina. I nodi di caricamento rileggono le cartelle in quel momento, non continuamente.
#Passaggio 3: caricare il workflow di editing e capire i suoi nodi
Apri il modello di workflow Qwen-Image-Edit dalla libreria. Se hai scaricato i file manualmente, ComfyUI potrebbe proporti di scaricarli di nuovo: rifiuta, poi seleziona i tuoi file nei node di caricamento. Il grafo conta una decina di node e ognuno ha un ruolo preciso.
- Load Diffusion Model
- Carica il file da models/diffusion_models. Il menu a discesa dovrebbe mostrare il tuo file Qwen-Image-Edit; se è vuoto, il file è stato sistemato nel posto sbagliato oppure l'interfaccia non è stata aggiornata.
- Load CLIP, tipo qwen_image
- Carica l'encoder Qwen2.5-VL da models/text_encoders. Il campo type deve avere il valore qwen_image. Con un altro tipo, l'encoder viene caricato senza errori ma il prompt viene interpretato male e ottieni risultati senza senso.
- Load VAE
- Il VAE Qwen. Nient’altro.
- Load Image, poi Scale Image to Total Pixels
- La tua immagine da modificare, ridimensionata a circa un megapixel. Questo ridimensionamento non è facoltativo: il modello è stato addestrato a questa scala e un input molto più grande peggiora la coerenza, aumentando al contempo la VRAM.
- TextEncodeQwenImageEdit
- Il node specifico di questa famiglia. Riceve l'encoder, il VAE, l'immagine e la tua istruzione e produce il conditioning. Ce ne sono due: uno per l'istruzione positiva e l'altro per quella negativa. Dalla versione 2509 in poi, il node si chiama TextEncodeQwenImageEditPlus e accetta fino a tre immagini.
- ModelSamplingAuraFlow e CFGNorm
- Due node per regolare il denoising, preimpostati nel workflow ufficiale, di cui uno con uno shift intorno a 3. Non rimuoverli: senza di essi, le immagini risultano sbiadite o troppo sature.
- KSampler, VAE Decode, Save Image
- Il denoising, la decodifica e il salvataggio, come in qualsiasi workflow ComfyUI. L'immagine viene salvata nella cartella output con il workflow completo inserito nel PNG.
Scrivi l’istruzione come un comando, non come la descrizione di un’immagine finale: « replace the text on the sign with OUVERT, keep the same font », « change the jacket to red leather, keep everything else », « remove the person on the left ». Il modello comprende soprattutto il cinese e l’inglese; il francese funziona spesso, ma l’inglese resta più affidabile per le istruzioni precise. Lascia vuota l’istruzione negativa oppure mantienila molto breve.
#Passaggio 4: le impostazioni e il LoRA Lightning per fare più in fretta
Il workflow ufficiale parte da 20 passaggi, un CFG di 2,5, il sampler euler e lo scheduler simple. Questi valori sono un buon punto di partenza: il CFG di questo modello è basso per costruzione, e portarlo a 7 come con SDXL produce immagini sature e deformate. Cambia prima il seed per ottenere varianti, poi il numero di passaggi se il risultato manca di finezza.
- 01Prima modifica senza LoRAAvvia il workflow così com’è su un’immagine semplice, con un’istruzione breve. Guarda il terminale: la prima esecuzione carica 30 GB di pesi dal disco, operazione che può richiedere diversi minuti. Le esecuzioni successive riutilizzano ciò che si trova in memoria.
- 02Aggiungere il LoRA LightningInserisci un node LoraLoaderModelOnly tra Load Diffusion Model e ModelSamplingAuraFlow, seleziona il LoRA Lightning 4 passi, imposta la forza su 1. Porta il KSampler a 4 passi e il CFG a 1,0: questi LoRA sono addestrati per funzionare senza guida. Il numero di passi è diviso per cinque, quindi anche il tempo di denoising nella stessa proporzione, al prezzo di una possibile perdita di fedeltà nei dettagli fini e nel testo, che il repository del LoRA non quantifica.
- 03Fissare il seed per confrontareImposta il KSampler su un seed fisso prima di confrontare due istruzioni o due varianti del modello. Altrimenti attribuirai alle impostazioni differenze dovute al caso.
- 04Eseguire più modifiche in sequenzaPer correggere in più passaggi, ricarica l’immagine di output come nuovo input. Ogni passaggio ripassa dal VAE e perde un po’ di dettaglio: limitati a due o tre e conserva l’originale.
#Passaggio 5: la variante GGUF per le schede da 12 a 16 GB e per i Mac
ComfyUI non legge nativamente i GGUF: serve l’estensione ComfyUI-GGUF di city96, disponibile in ComfyUI-Manager o tramite clone Git nella cartella custom_nodes. Aggiunge node di caricamento dedicati e la logica di organizzazione resta la stessa.
- 01Scegliere la quantizzazioneNel repository GGUF scelto, per esempio city96/Qwen-Image-Edit-gguf o QuantStack/Qwen-Image-Edit-2509-GGUF, la pagina elenca ogni file con le relative dimensioni. Scegli il file più grande che lasci circa 2 GB di margine nella tua VRAM dopo aver considerato la risoluzione desiderata: Q6_K o Q5_K_M per 16 GB, Q4_K_M per 12 GB. Come per gli LLM, Q4_K_M è il compromesso abituale; al di sotto di Q3, i testi e i piccoli dettagli ne risentono.
- 02Sistemare il fileIl GGUF del modello di diffusione va in models/diffusion_models o in models/unet, che l’estensione legge anch’essa. L’encoder di testo e il VAE restano quelli del passaggio 1, in safetensors.
- 03Sostituire il node di caricamentoNel workflow ufficiale, elimina Load Diffusion Model e sostituiscilo con Unet Loader (GGUF). Collega la sua uscita model al punto in cui era collegata quella precedente. Il resto del grafo non cambia: TextEncodeQwenImageEdit, VAE, KSampler, tutto funziona allo stesso modo.
- 04Mantenere l’encoder in safetensorsEsistono GGUF di Qwen2.5-VL 7B, ma quelli prodotti per llama.cpp sono pensati per il dialogo e potrebbero non includere la parte di visione necessaria all’editing per leggere l’immagine di input. Con il file ufficiale qwen_2.5_vl_7b_fp8_scaled.safetensors elimini una possibile causa di errore. Passa a un encoder GGUF solo se il repository indica esplicitamente la compatibilità con Qwen-Image-Edit in ComfyUI-GGUF.
Su Mac si applica la stessa procedura, con una sola differenza: controlla la pressione sulla memoria in Monitoraggio Attività. Quando la memoria unificata trabocca, macOS scrive sull’SSD e ogni immagine richiede diverse volte più tempo, senza mostrare messaggi di errore.
#Errori frequenti dei nodi con Qwen-Image-Edit
- Node rossi: TextEncodeQwenImageEdit o TextEncodeQwenImageEditPlus non trovato
- ComfyUI è troppo vecchio. Questi node fanno parte del nucleo di ComfyUI, non di un'estensione: nessun gestore li troverà. Aggiorna ComfyUI e riavvialo.
- Prompt outputs failed validation, value not in list
- Il file selezionato in un node di caricamento non esiste nella cartella prevista. Succede quando apri un workflow scaricato i cui nomi dei file differiscono dai tuoi. Riapri il menu a discesa di ogni node di caricamento e scegli il tuo file.
- Il tipo qwen_image non compare in Load CLIP
- Stessa causa: versione di ComfyUI precedente ad agosto 2025. Aggiorna.
- CUDA out of memory all'inizio del denoising
- I pesi superano la VRAM e l’offload non è bastato. Nell’ordine: riduci la risoluzione di output, passa a una quantizzazione GGUF più piccola, chiudi le altre applicazioni che occupano la GPU, poi prova le opzioni di memoria di ComfyUI descritte nella nostra guida all’installazione, come la riserva di VRAM o la disattivazione della VRAM dinamica.
- Immagine di output composta da rumore colorato o nera
- VAE o encoder di un'altra famiglia. Verifica che Load VAE punti a qwen_image_vae.safetensors e Load CLIP all'encoder Qwen2.5-VL con il tipo qwen_image.
- L'immagine non viene modificata, o lo è appena
- Istruzione troppo vaga oppure CFG sceso a 1 senza LoRA Lightning. Riporta il CFG a 2,5 senza LoRA, riformula l'istruzione come comando diretto e verifica che l'immagine sia collegata al node TextEncodeQwenImageEdit, non soltanto al VAE Encode.
- Il testo riscritto è falso o illeggibile
- Inserisci il testo desiderato tra virgolette nell'istruzione, specificando di mantenere il carattere tipografico. Le quantizzazioni più aggressive, Q2 e Q3, danneggiano per prime questa capacità: passa a Q4 o a FP8 per le modifiche al testo.
- Il workflow della versione 2509 accetta una sola immagine
- Hai caricato il vecchio node TextEncodeQwenImageEdit. Sostituiscilo con TextEncodeQwenImageEditPlus, che espone gli input image1, image2 e image3.
- Unet Loader (GGUF) assente dopo l’installazione dell’estensione
- Dipendenze Python non installate oppure ComfyUI non riavviato. Esegui di nuovo pip install sul file requirements.txt dell’estensione nell’ambiente di ComfyUI, quindi riavvia. Il terminale mostra all’avvio l’elenco delle estensioni caricate e gli eventuali errori di importazione.
#Per approfondire
- Installare ComfyUI e capire le sue opzioni di memoria
- Desktop, portatile o manuale, cartelle dei modelli, VRAM dinamica e opzioni della riga di comando. https://quelllm.fr/guide/comfyui-installation-guide-debutant
- Generare immagini localmente: il panorama
- Stable Diffusion, Flux, ComfyUI, Draw Things su Mac: quale opzione per quale hardware. https://quelllm.fr/guide/generer-images-en-local-guide
- ControlNet: controllare la composizione
- Posa, contorni, profondità: cosa integra nativamente la versione 2509 di Qwen-Image-Edit, spiegato su Stable Diffusion. https://quelllm.fr/guide/controlnet-guide-stable-diffusion
- VRAM: che cos’è e quanta ne serve
- Leggere la memoria della propria scheda, capire lo spostamento nella RAM, scegliere una scheda. https://quelllm.fr/guide/vram-c-est-quoi-combien-pour-ia
- Fonti ufficiali
- Repository GitHub QwenLM/Qwen-Image (elenco delle versioni e delle date), scheda Hugging Face Qwen/Qwen-Image-Edit (licenza Apache 2.0, esempio Diffusers), repository Comfy-Org/Qwen-Image-Edit_ComfyUI e Comfy-Org/Qwen-Image_ComfyUI (file FP8, dimensioni), tutorial Qwen-Image e Qwen-Image-Edit su docs.comfy.org (struttura delle cartelle, workflow), estensione github.com/city96/ComfyUI-GGUF.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.