Sostituire ChatGPT con un'IA locale: guida alla migrazione (2026)
Sì, per la maggior parte degli usi comuni: scrittura, riassunto, traduzione, codice, domande sui tuoi documenti. La migrazione si riduce a quattro passaggi: installare Ollama, aggiungere un'interfaccia come Open WebUI, scegliere un modello che rientri nella memoria disponibile, poi importare la tua cronologia ChatGPT. Ciò che non ritroverai in locale è il livello dei modelli di punta più grandi; tienili come riserva per le attività in cui fanno la differenza.
Lasciare ChatGPT non vuol dire abbandonare le proprie abitudini. Un'interfaccia di chat, una cronologia, assistenti preimpostati, l'analisi dei file, la ricerca web e la voce sono tutti disponibili in locale. Questa guida presenta le corrispondenze funzione per funzione, indica quale modello scegliere in base alla memoria disponibile e descrive in dettaglio la procedura per trasferire le tue conversazioni in locale.
#Ciò che guadagni, ciò che perdi
In locale, le tue conversazioni e i tuoi file rimangono sulla tua macchina: nulla transita attraverso un servizio di terzi e l'assistente funziona senza connessione una volta scaricato il modello. Non ci sono abbonamenti né limiti al numero di messaggi: il costo è quello dell'hardware e dell'elettricità. Puoi anche scegliere il modello, le sue impostazioni e le sue istruzioni. In cambio, perdi l'accesso automatico ai modelli all'avanguardia di maggiori dimensioni, che non trovano spazio su un computer personale, e una parte dell'integrazione pronta all'uso: applicazioni mobili, voce fluida, agenti collegati ai tuoi account. Il confronto numerico delle prestazioni e dei costi si trova nella nostra guida «IA locale vs ChatGPT».
| Funzione ChatGPT | Equivalente locale | Cosa sapere |
|---|---|---|
| Chat con cronologia | Open WebUI, LM Studio, Jan, Msty | Open WebUI conserva le conversazioni in un volume Docker |
| Importazione delle tue vecchie conversazioni | La funzione «Import Chats» di Open WebUI | Il formato ChatGPT è rilevato automaticamente |
| GPT personalizzati | Modelli personalizzati di Open WebUI | Istruzioni, strumenti e conoscenze in un unico pacchetto |
| Memoria | Memoria di Open WebUI | Fatti ricordati da una conversazione all'altra |
| File allegati, analisi di documenti | Base di conoscenza (RAG) | Il contesto del modello rimane limitato: vedere più avanti |
| Ricerca web | Ricerca web di Open WebUI, SearXNG | Fonti citate; dipende dal motore configurato |
| Voce | Riconoscimento e sintesi vocale di Open WebUI | Latenza superiore a quella di un servizio cloud |
| Immagini | ComfyUI o Stable Diffusion | Modello e GPU distinti dal modello di testo |
| Modello di punta | Nessun equivalente completo | Mantieni un'API o un abbonamento come riserva |
#Scegliere il modello in base alla memoria disponibile
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La regola è scegliere il modello più grande che rientra comodamente in Q4 nella tua VRAM o nella tua memoria unificata, contesto compreso. Il catalogo QuelLLM indica, per ogni modello, la memoria occupata in Q4 dai soli pesi: le cifre qui sotto sono tratte da quel catalogo. Aggiungi la cache KV e un margine del 20%; la guida sulla finestra di contesto spiega il calcolo.
| Memoria disponibile | Modello possibile | Pesi in Q4 | A cosa serve |
|---|---|---|---|
| 8 GB | Qwen 3.5 9B | circa 6 GB | Scrittura, riassunti, domande comuni |
| 12 GB | Gemma 4 12B | circa 7 GB | Assistente generalista con margine per il contesto |
| 16 GB | Mistral Small 3.2 24B o gpt-oss 20B | Da 14 a 13 GB | Ragionamento e contesto più lungo |
| 24 GB | Qwen 3.8 27B | circa 16 GB | Uso quotidiano impegnativo, codice |
| 32 GB | Qwen 3.6 35B-A3B (MoE) | circa 21 GB | Velocità elevata rispetto alle dimensioni del modello, contesti lunghi |
| 64 GB e oltre | Llama 3.3 70B o gpt-oss 120B | Da 40 a 70 GB | Qualità simile a quella dei modelli cloud comuni |
#Ritrovare un'interfaccia di chat
- Open WebUI
- L'interfaccia web più vicina a ChatGPT: cronologia, prompt di sistema, file allegati, ricerca web, memoria e modelli personalizzati. Si collega a Ollama o a qualsiasi API compatibile con OpenAI.
- LM Studio
- Applicazione desktop che scarica i modelli e offre una chat: il modo più veloce per iniziare senza terminale.
- Jan
- Applicazione desktop semplice, orientata alla privacy, con chat e gestione dei modelli.
- Msty
- Interfaccia curata per Mac, Windows e Linux, con diversi modelli affiancati.
Per una prima installazione, LM Studio o Jan bastano. Scegli Open WebUI se più persone devono usarlo, se vuoi memoria, modelli personalizzati o l'importazione del tuo storico.
#Importare la tua cronologia di ChatGPT
Open WebUI sa leggere l'export di ChatGPT senza conversione preliminare: la documentazione specifica che il formato ChatGPT è riconosciuto e convertito automaticamente. Le vostre conversazioni vengono aggiunte a quelle esistenti, e ogni importazione riceve un nuovo identificativo: importare nuovamente lo stesso file crea duplicati. Quindi fate l'importazione una sola volta, dopo aver verificato il file.
- 01Chiedere l'esportazione a ChatGPTIn ChatGPT, apri Impostazioni, Controllo dei dati (Data controls), poi Esporta i dati (Export data) e Richiedi l'esportazione. Riceverai via email un link per il download; la dicitura esatta dipende dalla lingua dell'interfaccia.
- 02Estrarre l'archivioDecomprimi il file ricevuto e individua conversations.json, che contiene la cronologia.
- 03Eseguire il backup di Open WebUIPrima di importare, esporta le tue conversazioni Open WebUI esistenti dalle Impostazioni, Controllo dei dati, Esporta le discussioni, per poter tornare indietro.
- 04ImportareIn Open WebUI: nome utente in basso a sinistra, Impostazioni, Controllo dei dati, Importa discussioni, poi scegli conversations.json. L'etichetta varia in base alla lingua.
- 05ControllareApri alcune conversazioni vecchie: i messaggi devono apparire in ordine. Il modello visualizzato in una conversazione importata non riflette necessariamente il modello di origine.
#Installare lo stack: Ollama, Open WebUI, un modello
La procedura seguente presuppone che Docker sia installato per Open WebUI. Senza Docker, LM Studio o Jan sostituiscono l’intera configurazione con un’unica applicazione.
- 01Installare OllamaSegui la guida di installazione del tuo sistema. Ollama ascolta per impostazione predefinita su http://localhost:11434.
- 02Scaricare un modelloScegli in base alla tabella qui sopra, ad esempio usando ollama pull seguito dal nome del modello. Verifica le dimensioni del modello prima di scaricarlo.
- 03Avviare Open WebUILa documentazione ufficiale propone un comando Docker che monta un volume per conservare i tuoi dati e consente a Open WebUI di raggiungere Ollama sulla macchina host.
- 04Regolare il contestoCon meno di 24 GiB di VRAM, Ollama usa un contesto di circa 4.000 token, troncando i documenti lunghi. Aumentalo in base alla memoria disponibile.
L'opzione relativa al volume conserva le tue conversazioni durante gli aggiornamenti, e la chiave segreta deve essere impostata una volta per tutte: senza una chiave stabile, ogni ricreazione del container disconnette gli utenti, come precisa la documentazione. Sostituisci your-secret-key con un valore generato, ad esempio con openssl rand -hex 32. L'interfaccia risponde quindi sulla porta 3000 della tua macchina.
#Ritrovare i tuoi casi d'uso uno per uno
- Parlare, scrivere, tradurre
- Disponibile appena viene caricato un modello. La qualità dipende dalle dimensioni del modello: un 9B basta per un'email, un 27B o più per un testo lungo e ricco di sfumature.
- Analizzare i tuoi documenti
- Le basi di conoscenza di Open WebUI, AnythingLLM o PrivateGPT recuperano i passaggi utili invece di inviare tutto al modello. È il metodo giusto quando i tuoi documenti superano la finestra di contesto.
- Coder
- Estensioni come Cline o Continue si collegano a Ollama. Ollama consiglia almeno 64.000 token di contesto per gli strumenti di programmazione.
- Ritrovare i tuoi GPT
- Ricrea ogni GPT come un modello personalizzato: istruzioni di sistema, strumenti e conoscenze raccolte. Copia le tue istruzioni da ChatGPT.
- Cercare sul web
- Attiva la ricerca web di Open WebUI o collega SearXNG perché il modello citi fonti.
#Quando tenere ChatGPT o un'API cloud in riserva
Tre situazioni giustificano il mantenimento di un legame con il cloud: un ragionamento molto lungo su un problema difficile, un'attività che richiede un contesto di diverse centinaia di migliaia di token o un utilizzo da dispositivo mobile con interazione vocale continua. Un approccio ibrido funziona bene: l'IA locale per tutto ciò che è riservato o ripetitivo, il cloud per le eccezioni, senza mai incollarvi dati sensibili. Open WebUI permette di collegare un fornitore esterno accanto a Ollama e di confrontare due modelli fianco a fianco, il che aiuta a valutare se l'IA locale basta per il tuo caso.
#Migrare senza rischi: prima una prova in parallelo
Non disdire nulla il primo giorno. La soluzione più sicura è usare i due strumenti fianco a fianco per una o due settimane, ponendo la stessa domanda a entrambi ogni volta che il risultato conta. Annota i casi in cui l'assistente locale delude: indicano se serve un modello più grande, una finestra più ampia, un prompt migliore o, sinceramente, un uso da mantenere nel cloud.
- 01Giorni 1 e 2: installare e testareInstalla lo stack, carica il modello adatto alla memoria disponibile e ripeti cinque conversazioni tipiche della tua cronologia ChatGPT.
- 02Giorni da 3 a 7: affiancare un'IA locale a ChatGPTUsa l'IA locale per tutte le attività abituali; ricorri a ChatGPT solo quando la risposta locale non basta e annota il motivo.
- 03Settimana 2: importare e ricreareImporta la tua cronologia una sola volta, ricrea i GPT che usi di più come modelli personalizzati, attiva la ricerca web se ne hai bisogno.
- 04Fine del periodo: decidereConta i casi in cui hai dovuto tornare al cloud. Se succede raramente, puoi interrompere l'abbonamento; altrimenti, mantienilo o passa a un'API fatturata in base all'utilizzo.
#Le delusioni più comuni dopo la migrazione
- Il contesto taglia i tuoi documenti
- Ollama parte con una finestra di contesto di circa 4.000 token su una scheda con meno di 24 GiB: un lungo PDF incollato nella chat viene troncato senza un avviso evidente. Aumenta la finestra, nei limiti della memoria disponibile.
- Un modello troppo piccolo o troppo compresso
- Un 3B o un 7B a 2 bit darà l'impressione che l'IA locale sia mediocre. Passa a un modello più grande prima di trarre conclusioni ed evita le quantizzazioni sotto i 4 bit.
- Un modello di ragionamento lento
- Alcuni modelli riflettono a lungo prima di rispondere: la risposta arriva dopo diverse decine di secondi. Scegli un modello senza ragionamento per le conversazioni quotidiane.
- Prompt scritti per ChatGPT
- Un modello locale segue meno bene le istruzioni vaghe. Specifica il ruolo, il formato e la lingua di risposta nel prompt di sistema.
#Ciò che esce ancora dalla tua macchina
Locale non vuol dire ermetico. La ricerca web di Open WebUI invia le tue richieste al motore di ricerca configurato; un modello con etichetta Ollama che termina con cloud viene eseguito sui server del fornitore, come kimi-k3:cloud nella biblioteca di Ollama; e collegare un fornitore esterno accanto a Ollama, cosa che Open WebUI permette, invia i tuoi messaggi a quel fornitore. Per una vera privacy, disattiva queste opzioni o riservale a un profilo separato e verifica l'elenco dei modelli installati prima di elaborare documenti sensibili.
È davvero possibile sostituire ChatGPT con un'IA locale?+
Come recuperare le mie conversazioni con ChatGPT?+
Quale interfaccia assomiglia di più a ChatGPT?+
Quale modello prendere con 16 GB di memoria?+
E i miei GPT personalizzati?+
È davvero gratuito?+
#Per approfondire
- Installare Ollama in 5 minuti
- Open WebUI con Ollama: guida completa
- IA locale vs ChatGPT: confronto
- Comprendere la finestra di contesto
- RAG locale con Ollama senza scrivere codice
- SearXNG: la ricerca web per un modello locale
- Fonte: Open WebUI, importazione e esportazione delle conversazioni
- Fonte: Open WebUI, funzionalità
- Fonte: Open WebUI, avvio rapido
- Fonte: Ollama, lunghezza del contesto
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.