Intermedio 11 minMigrazione

Sostituire ChatGPT con un'IA locale: guida alla migrazione (2026)

Risposta diretta

Sì, per la maggior parte degli usi comuni: scrittura, riassunto, traduzione, codice, domande sui tuoi documenti. La migrazione si riduce a quattro passaggi: installare Ollama, aggiungere un'interfaccia come Open WebUI, scegliere un modello che rientri nella memoria disponibile, poi importare la tua cronologia ChatGPT. Ciò che non ritroverai in locale è il livello dei modelli di punta più grandi; tienili come riserva per le attività in cui fanno la differenza.

Lasciare ChatGPT non vuol dire abbandonare le proprie abitudini. Un'interfaccia di chat, una cronologia, assistenti preimpostati, l'analisi dei file, la ricerca web e la voce sono tutti disponibili in locale. Questa guida presenta le corrispondenze funzione per funzione, indica quale modello scegliere in base alla memoria disponibile e descrive in dettaglio la procedura per trasferire le tue conversazioni in locale.

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux

#Ciò che guadagni, ciò che perdi

In locale, le tue conversazioni e i tuoi file rimangono sulla tua macchina: nulla transita attraverso un servizio di terzi e l'assistente funziona senza connessione una volta scaricato il modello. Non ci sono abbonamenti né limiti al numero di messaggi: il costo è quello dell'hardware e dell'elettricità. Puoi anche scegliere il modello, le sue impostazioni e le sue istruzioni. In cambio, perdi l'accesso automatico ai modelli all'avanguardia di maggiori dimensioni, che non trovano spazio su un computer personale, e una parte dell'integrazione pronta all'uso: applicazioni mobili, voce fluida, agenti collegati ai tuoi account. Il confronto numerico delle prestazioni e dei costi si trova nella nostra guida «IA locale vs ChatGPT».

Ciò che usi su ChatGPT e il suo equivalente locale
Funzione ChatGPTEquivalente localeCosa sapere
Chat con cronologiaOpen WebUI, LM Studio, Jan, MstyOpen WebUI conserva le conversazioni in un volume Docker
Importazione delle tue vecchie conversazioniLa funzione «Import Chats» di Open WebUIIl formato ChatGPT è rilevato automaticamente
GPT personalizzatiModelli personalizzati di Open WebUIIstruzioni, strumenti e conoscenze in un unico pacchetto
MemoriaMemoria di Open WebUIFatti ricordati da una conversazione all'altra
File allegati, analisi di documentiBase di conoscenza (RAG)Il contesto del modello rimane limitato: vedere più avanti
Ricerca webRicerca web di Open WebUI, SearXNGFonti citate; dipende dal motore configurato
VoceRiconoscimento e sintesi vocale di Open WebUILatenza superiore a quella di un servizio cloud
ImmaginiComfyUI o Stable DiffusionModello e GPU distinti dal modello di testo
Modello di puntaNessun equivalente completoMantieni un'API o un abbonamento come riserva

#Scegliere il modello in base alla memoria disponibile

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La regola è scegliere il modello più grande che rientra comodamente in Q4 nella tua VRAM o nella tua memoria unificata, contesto compreso. Il catalogo QuelLLM indica, per ogni modello, la memoria occupata in Q4 dai soli pesi: le cifre qui sotto sono tratte da quel catalogo. Aggiungi la cache KV e un margine del 20%; la guida sulla finestra di contesto spiega il calcolo.

Modelli consigliati in base alla memoria disponibile (catalogo QuelLLM, Q4, solo pesi)
Memoria disponibileModello possibilePesi in Q4A cosa serve
8 GBQwen 3.5 9Bcirca 6 GBScrittura, riassunti, domande comuni
12 GBGemma 4 12Bcirca 7 GBAssistente generalista con margine per il contesto
16 GBMistral Small 3.2 24B o gpt-oss 20BDa 14 a 13 GBRagionamento e contesto più lungo
24 GBQwen 3.8 27Bcirca 16 GBUso quotidiano impegnativo, codice
32 GBQwen 3.6 35B-A3B (MoE)circa 21 GBVelocità elevata rispetto alle dimensioni del modello, contesti lunghi
64 GB e oltreLlama 3.3 70B o gpt-oss 120BDa 40 a 70 GBQualità simile a quella dei modelli cloud comuni
i
Un MoE si comporta diversamente
Un modello a esperti multipli come Qwen 3.6 35B-A3B richiede la memoria dei suoi 35 miliardi di parametri, ma ne attiva soltanto 3 miliardi per token: genera molto più velocemente di un modello denso delle stesse dimensioni. Vedi la guida sui MoE.

#Ritrovare un'interfaccia di chat

Open WebUI
L'interfaccia web più vicina a ChatGPT: cronologia, prompt di sistema, file allegati, ricerca web, memoria e modelli personalizzati. Si collega a Ollama o a qualsiasi API compatibile con OpenAI.
LM Studio
Applicazione desktop che scarica i modelli e offre una chat: il modo più veloce per iniziare senza terminale.
Jan
Applicazione desktop semplice, orientata alla privacy, con chat e gestione dei modelli.
Msty
Interfaccia curata per Mac, Windows e Linux, con diversi modelli affiancati.

Per una prima installazione, LM Studio o Jan bastano. Scegli Open WebUI se più persone devono usarlo, se vuoi memoria, modelli personalizzati o l'importazione del tuo storico.

#Importare la tua cronologia di ChatGPT

Open WebUI sa leggere l'export di ChatGPT senza conversione preliminare: la documentazione specifica che il formato ChatGPT è riconosciuto e convertito automaticamente. Le vostre conversazioni vengono aggiunte a quelle esistenti, e ogni importazione riceve un nuovo identificativo: importare nuovamente lo stesso file crea duplicati. Quindi fate l'importazione una sola volta, dopo aver verificato il file.

  1. 01
    Chiedere l'esportazione a ChatGPT
    In ChatGPT, apri Impostazioni, Controllo dei dati (Data controls), poi Esporta i dati (Export data) e Richiedi l'esportazione. Riceverai via email un link per il download; la dicitura esatta dipende dalla lingua dell'interfaccia.
  2. 02
    Estrarre l'archivio
    Decomprimi il file ricevuto e individua conversations.json, che contiene la cronologia.
  3. 03
    Eseguire il backup di Open WebUI
    Prima di importare, esporta le tue conversazioni Open WebUI esistenti dalle Impostazioni, Controllo dei dati, Esporta le discussioni, per poter tornare indietro.
  4. 04
    Importare
    In Open WebUI: nome utente in basso a sinistra, Impostazioni, Controllo dei dati, Importa discussioni, poi scegli conversations.json. L'etichetta varia in base alla lingua.
  5. 05
    Controllare
    Apri alcune conversazioni vecchie: i messaggi devono apparire in ordine. Il modello visualizzato in una conversazione importata non riflette necessariamente il modello di origine.

#Installare lo stack: Ollama, Open WebUI, un modello

La procedura seguente presuppone che Docker sia installato per Open WebUI. Senza Docker, LM Studio o Jan sostituiscono l’intera configurazione con un’unica applicazione.

  1. 01
    Installare Ollama
    Segui la guida di installazione del tuo sistema. Ollama ascolta per impostazione predefinita su http://localhost:11434.
  2. 02
    Scaricare un modello
    Scegli in base alla tabella qui sopra, ad esempio usando ollama pull seguito dal nome del modello. Verifica le dimensioni del modello prima di scaricarlo.
  3. 03
    Avviare Open WebUI
    La documentazione ufficiale propone un comando Docker che monta un volume per conservare i tuoi dati e consente a Open WebUI di raggiungere Ollama sulla macchina host.
  4. 04
    Regolare il contesto
    Con meno di 24 GiB di VRAM, Ollama usa un contesto di circa 4.000 token, troncando i documenti lunghi. Aumentalo in base alla memoria disponibile.
Open WebUI con Docker (comando tratto dalla documentazione ufficiale)
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=your-secret-key --name open-webui --restart always ghcr.io/open-webui/open-webui:main

L'opzione relativa al volume conserva le tue conversazioni durante gli aggiornamenti, e la chiave segreta deve essere impostata una volta per tutte: senza una chiave stabile, ogni ricreazione del container disconnette gli utenti, come precisa la documentazione. Sostituisci your-secret-key con un valore generato, ad esempio con openssl rand -hex 32. L'interfaccia risponde quindi sulla porta 3000 della tua macchina.

#Ritrovare i tuoi casi d'uso uno per uno

Parlare, scrivere, tradurre
Disponibile appena viene caricato un modello. La qualità dipende dalle dimensioni del modello: un 9B basta per un'email, un 27B o più per un testo lungo e ricco di sfumature.
Analizzare i tuoi documenti
Le basi di conoscenza di Open WebUI, AnythingLLM o PrivateGPT recuperano i passaggi utili invece di inviare tutto al modello. È il metodo giusto quando i tuoi documenti superano la finestra di contesto.
Coder
Estensioni come Cline o Continue si collegano a Ollama. Ollama consiglia almeno 64.000 token di contesto per gli strumenti di programmazione.
Ritrovare i tuoi GPT
Ricrea ogni GPT come un modello personalizzato: istruzioni di sistema, strumenti e conoscenze raccolte. Copia le tue istruzioni da ChatGPT.
Cercare sul web
Attiva la ricerca web di Open WebUI o collega SearXNG perché il modello citi fonti.

#Quando tenere ChatGPT o un'API cloud in riserva

Tre situazioni giustificano il mantenimento di un legame con il cloud: un ragionamento molto lungo su un problema difficile, un'attività che richiede un contesto di diverse centinaia di migliaia di token o un utilizzo da dispositivo mobile con interazione vocale continua. Un approccio ibrido funziona bene: l'IA locale per tutto ciò che è riservato o ripetitivo, il cloud per le eccezioni, senza mai incollarvi dati sensibili. Open WebUI permette di collegare un fornitore esterno accanto a Ollama e di confrontare due modelli fianco a fianco, il che aiuta a valutare se l'IA locale basta per il tuo caso.

#Migrare senza rischi: prima una prova in parallelo

Non disdire nulla il primo giorno. La soluzione più sicura è usare i due strumenti fianco a fianco per una o due settimane, ponendo la stessa domanda a entrambi ogni volta che il risultato conta. Annota i casi in cui l'assistente locale delude: indicano se serve un modello più grande, una finestra più ampia, un prompt migliore o, sinceramente, un uso da mantenere nel cloud.

  1. 01
    Giorni 1 e 2: installare e testare
    Installa lo stack, carica il modello adatto alla memoria disponibile e ripeti cinque conversazioni tipiche della tua cronologia ChatGPT.
  2. 02
    Giorni da 3 a 7: affiancare un'IA locale a ChatGPT
    Usa l'IA locale per tutte le attività abituali; ricorri a ChatGPT solo quando la risposta locale non basta e annota il motivo.
  3. 03
    Settimana 2: importare e ricreare
    Importa la tua cronologia una sola volta, ricrea i GPT che usi di più come modelli personalizzati, attiva la ricerca web se ne hai bisogno.
  4. 04
    Fine del periodo: decidere
    Conta i casi in cui hai dovuto tornare al cloud. Se succede raramente, puoi interrompere l'abbonamento; altrimenti, mantienilo o passa a un'API fatturata in base all'utilizzo.

#Le delusioni più comuni dopo la migrazione

Il contesto taglia i tuoi documenti
Ollama parte con una finestra di contesto di circa 4.000 token su una scheda con meno di 24 GiB: un lungo PDF incollato nella chat viene troncato senza un avviso evidente. Aumenta la finestra, nei limiti della memoria disponibile.
Un modello troppo piccolo o troppo compresso
Un 3B o un 7B a 2 bit darà l'impressione che l'IA locale sia mediocre. Passa a un modello più grande prima di trarre conclusioni ed evita le quantizzazioni sotto i 4 bit.
Un modello di ragionamento lento
Alcuni modelli riflettono a lungo prima di rispondere: la risposta arriva dopo diverse decine di secondi. Scegli un modello senza ragionamento per le conversazioni quotidiane.
Prompt scritti per ChatGPT
Un modello locale segue meno bene le istruzioni vaghe. Specifica il ruolo, il formato e la lingua di risposta nel prompt di sistema.

#Ciò che esce ancora dalla tua macchina

Locale non vuol dire ermetico. La ricerca web di Open WebUI invia le tue richieste al motore di ricerca configurato; un modello con etichetta Ollama che termina con cloud viene eseguito sui server del fornitore, come kimi-k3:cloud nella biblioteca di Ollama; e collegare un fornitore esterno accanto a Ollama, cosa che Open WebUI permette, invia i tuoi messaggi a quel fornitore. Per una vera privacy, disattiva queste opzioni o riservale a un profilo separato e verifica l'elenco dei modelli installati prima di elaborare documenti sensibili.

FAQ
È davvero possibile sostituire ChatGPT con un'IA locale?+
Per la maggior parte degli usi comuni, sì: scrittura, riassunto, traduzione, programmazione e domande sui tuoi documenti funzionano bene con un modello da 9 a 30 miliardi di parametri. I compiti di ragionamento molto difficili restano appannaggio dei modelli cloud più grandi. Fai delle prove sui tuoi casi d'uso prima di disdire un abbonamento.
Come recuperare le mie conversazioni con ChatGPT?+
In ChatGPT, richiedi l'esportazione tramite Impostazioni, Controllo dei dati, Esporta i dati. Riceverai per e-mail un archivio contenente conversations.json. Importa questo file in Open WebUI con Importa discussioni: il formato viene rilevato automaticamente. Importalo solo una volta, altrimenti creerai duplicati.
Quale interfaccia assomiglia di più a ChatGPT?+
Open WebUI è l'interfaccia più completa: cronologia, file allegati, ricerca web, memoria, modelli personalizzati e importazione diretta dei dati esportati da ChatGPT. LM Studio e Jan sono più semplici da installare, senza Docker né terminale, ma offrono meno funzionalità di lavoro in team e di personalizzazione.
Quale modello prendere con 16 GB di memoria?+
Secondo il catalogo QuelLLM, Mistral Small 3.2 24B e gpt-oss 20B possono essere caricati in Q4, con pesi che occupano rispettivamente circa 14 e 13 GB. Ciò lascia poco margine per il contesto: limita la finestra, oppure scegli un modello da 9 a 12 miliardi di parametri per lavorare con un contesto lungo.
E i miei GPT personalizzati?+
Non si possono esportare così come sono. Copia le loro istruzioni e ricrea ciascuno come un modello personalizzato in Open WebUI, associandogli i tuoi file di conoscenza. Questo lavoro richiede pochi minuti per assistente e puoi poi scegliere il modello sottostante, cosa che ChatGPT non permette.
È davvero gratuito?+
I software citati sono per la maggior parte gratuiti e liberi, e non hai un abbonamento da pagare. Restano i costi dell'hardware, dell'elettricità e del tempo che dedichi alla configurazione. Se la tua macchina attuale riesce a caricare solo un modello piccolo, il risultato sarà più limitato rispetto a quello di ChatGPT.

#Per approfondire

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.