Un'IA offline: usare un LLM senza connessione internet
Un LLM locale ha bisogno di internet solo per essere scaricato. Una volta che il modello è sul tuo disco, un'IA offline funziona interamente senza connessione: in aereo, in una zona senza copertura, durante un'escursione o su un computer isolato dalla rete. Questa guida mostra come preparare la tua macchina prima di partire, quali modelli compatti portare con te e come verificare tutto per non ritrovarti bloccato al momento sbagliato.
#Perché un'IA offline
Gli assistenti cloud (ChatGPT, Claude, Gemini) si fermano di colpo appena cade la connessione. Un'IA offline, invece, funziona interamente sul tuo computer: il modello è caricato in memoria e calcola le risposte localmente, senza mai interrogare un server remoto. È lo stesso principio di un LLM locale classico, portato alla sua logica conclusione: nessuna dipendenza dalla rete una volta completata la preparazione.
Le situazioni in cui questo cambia tutto sono più frequenti di quanto si creda: un volo a lungo raggio, un viaggio in treno senza 4G, una missione in una zona senza copertura di rete, un cantiere o un sito industriale senza Wi-Fi, oppure una postazione volutamente disconnessa da internet per motivi di riservatezza. In tutti questi casi, un'IA offline ben preparata rimane pienamente operativa.
- Autonomia totale
- Nessuna interruzione quando la rete si interrompe: aereo, tunnel, campagna, sotterraneo.
- Privacy
- Nulla esce dalla macchina. Ideale per dati sensibili o una postazione air-gapped.
- Nessun costo ricorrente
- Nessun abbonamento, nessuna fatturazione per token, nessuna quota.
- Latenza stabile
- La velocità dipende solo dal tuo hardware, non da un server sovraccarico all'altro capo del mondo.
#Ciò che ha bisogno della rete (e ciò che non ne ha bisogno)
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Capire la differenza tra « online » e « offline » evita brutte sorprese. Una sola fase richiede internet: il download. Tutto il resto è locale.
- Serve la rete (una volta)
- Scaricare l'applicazione (Ollama, LM Studio), scaricare i modelli (file GGUF), recuperare gli aggiornamenti.
- 100 % offline
- Caricare un modello già presente, conversare, generare testo o codice, riassumere un documento locale, usare un RAG sui tuoi file.
#Prerequisiti prima di partire
Un'IA offline può funzionare su un normale computer portatile. Ciò che conta è la RAM (o la VRAM se hai una GPU) e lo spazio su disco per memorizzare i modelli.
- Spazio libero sul disco
- Prevedere da 5 a 30 GB in base ai modelli integrati. Un modello 7B in Q4_K_M pesa circa 4,5 GB, un 14B circa 9 GB.
- RAM / VRAM
- 8 GB per un modello 3B, 16 GB per usare comodamente un 7B, 32 GB per puntare a un 14B. Valori di riferimento per la VRAM in Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
- GPU (opzionale)
- Una GPU accelera molto ma non è obbligatoria. Un MacBook Apple Silicon (serie M) o un PC con 16 GB di RAM sono sufficienti anche usando solo la CPU.
- Batteria
- L'inferenza impegna la CPU/GPU: su un portatile scollegato dall'alimentazione, aspettati un'autonomia ridotta. Preferisci modelli compatti quando sei in mobilità.
#Scaricare tutto prima di perdere la connessione
È la fase decisiva e l'unica che richiede internet. Completala con calma a casa o in ufficio, tramite Wi-Fi, qualche ora prima della partenza: un modello di diversi GB non ama le connessioni instabili. Ecco la procedura da seguire con Ollama, l'approccio più semplice per un'IA offline.
- 01Installare Ollama mentre hai una connessione a InternetScarica e installa Ollama dal sito ollama.com. È il daemon che farà funzionare i tuoi modelli localmente, in ascolto su http://localhost:11434. Installalo prima di tutto, perché l'app stessa viene scaricata online.
- 02Scaricare uno o due modelli compattiUsa ollama pull per scaricare i modelli sul disco. Scegli dimensioni adatte alla tua macchina (vedi sezione successiva). Un pull con una connessione Wi-Fi stabile richiede da pochi minuti a un quarto d'ora, a seconda della velocità di trasferimento e delle dimensioni.
- 03Installare un'interfaccia grafica (opzionale)Se preferisci una finestra di chat a un terminale, installa LM Studio (tutto in uno, gestisce anche il download) o Open WebUI. LM Studio è particolarmente pratico in mobilità: app + modelli + interfaccia in un solo strumento.
- 04Eseguire una prova con ogni modello una voltaAvvia una conversazione di prova con ogni modello scaricato mentre hai ancora una connessione di rete. Questo conferma che il file è completo e si carica correttamente in memoria.
#I modelli compatti che bastano per l'uso in mobilità
Quando usi un portatile offline, l'efficienza energetica viene prima di tutto: un modello piccolo e veloce che consuma poca batteria è meglio di un mastodonte che arranca e la scarica. Per la maggior parte degli usi in mobilità — scrittura, riassunti, domande generali, assistenza alla programmazione — un modello da 2B a 9B in Q4_K_M svolge molto bene il lavoro.
- Qwen 3.5 2B
- ~1,9 GB. Il più leggero: ideale per un vecchio laptop o per risparmiare la batteria. Multimodale, 256k di contesto, licenza Apache 2.0. Abbastanza per scrivere, riformulare, rispondere a domande semplici.
- Qwen 3.5 9B
- ~6,6 GB. Eccellente modello versatile, valido nel ragionamento, nella visione e nella programmazione, con un contesto di 256k. Il miglior compromesso per un laptop con 16 GB di RAM — la scelta di riferimento per 8 GB nel 2026.
- Granite 4.2 8B
- ~5,3 GB. Parco nei consumi ed efficiente nell'uso dei token (IBM, Apache 2.0), 128k di contesto, risposte concise. Una scelta affidabile per la scrittura che preserva la batteria.
- Granite 4.2 3B
- ~2,2 GB. Compatto e veloce, molto parsimonioso nell'uso delle risorse, pensato per macchine modeste pur mantenendo buone capacità.
La quantizzazione Q4_K_M è l'impostazione predefinita consigliata: riduce notevolmente la dimensione del modello e la memoria necessaria, con una perdita di qualità minima e impercettibile nella maggior parte degli usi. Se hai margine in RAM/VRAM e cerchi un po' più di precisione, Q5_K_M è un'alternativa. Riserva Q8_0 e FP16 alle macchine con risorse molto abbondanti.
#Verificare che tutto funzioni veramente offline
Non fidarti mai sulla parola: prova in condizioni reali prima di trovarti senza rete. Un test di tre minuti evita una delusione a 10.000 metri d'altitudine.
- 01Disconnettere completamente la macchina dalla reteAttiva la modalità aereo, disattiva SIA il Wi-Fi SIA l'Ethernet. L'obiettivo è riprodurre esattamente l'assenza totale di connessione.
- 02Avviare una conversazioneApri il terminale o LM Studio e parla con ogni modello scaricato. Se il modello risponde, la tua IA offline è funzionante.
- 03Controllare che nessun errore di rete impedisca il funzionamentoAlcune interfacce mostrano un banner di avviso quando sono offline: finché la generazione funziona, ignoralo. Se la chat si rifiuta di avviarsi, probabilmente il modello non era stato completamente scaricato.
#Postazione isolata e uso air-gapped
Alcune macchine sono mantenute intenzionalmente scollegate da Internet in modo permanente: postazioni che elaborano dati riservati, ambienti industriali, laboratori. È l'uso «air-gapped»: la macchina di destinazione non avrà mai accesso alla rete, nemmeno per l'installazione.
Il principio: preparare i file su una macchina connessa, poi trasferirli tramite chiavetta USB o disco esterno al computer isolato. Ollama conserva i suoi modelli in una cartella che puoi copiare così com'è.
- Installatori offline
- Scarica il binario di installazione di Ollama o di LM Studio da una macchina connessa, poi copialo sul computer isolato.
- File dei modelli
- Su Linux/macOS, i modelli Ollama si trovano in ~/.ollama/models; su Windows, in %USERPROFILE%\.ollama\models. Copia questa cartella sul computer di destinazione nello stesso percorso.
- Alternativa GGUF
- Con LM Studio, basta copiare i file .gguf scaricati nella cartella dei modelli dell'app sulla macchina isolata.
#Aggiornare i tuoi modelli appena torni online
Una volta tornato in una zona coperta, è il momento di mantenere aggiornata la tua installazione: recuperare le nuove versioni dei modelli, aggiungere nuovi modelli scoperti durante il percorso e aggiornare l'applicazione. Niente di tutto questo si può fare offline, per cui è importante farlo appena torna la connessione.
- 01Aggiornare i modelli esistentiUn ollama pull sur un modello già presente scarica solo le layer modificate se esiste una nuova versione. È veloce e mantiene i tuoi modelli aggiornati.
- 02Aggiornare l'applicazioneEsegui di nuovo il programma di installazione di Ollama o LM Studio per beneficiare delle correzioni e del supporto per nuovi modelli. Gli aggiornamenti sono frequenti in questo ecosistema.
- 03Fare puliziaElimina i modelli che non utilizzi più per liberare spazio su disco prima del tuo prossimo viaggio.
- 04Riprovare in modalità aereoDopo ogni aggiornamento, ripeti un test offline: una nuova versione dell'app potrebbe introdurre un comportamento imprevisto in assenza di rete.
#Risoluzione dei problemi
- « Model not found » offline
- Il modello non era (completamente) stato scaricato prima della interruzione. Riconnetti, riavvia ollama pull jusqu al messaggio successo, poi verifica con ollama list.
- L'app rifiuta di avviarsi senza rete
- Alcune interfacce tentano una verifica online all'avvio. Aspetta qualche secondo che la verifica vada in timeout, oppure disattiva il controllo degli aggiornamenti nelle impostazioni.
- Risposte molto lente quando sei in viaggio
- Usando solo la CPU e con alimentazione a batteria, è normale. Passa a un modello più piccolo (3B) e chiudi le applicazioni che consumano molte risorse. Collega il portatile alla corrente, se possibile.
- Batteria che si scarica a vista d'occhio
- L'inferenza sollecita molto il processore. Riduci le dimensioni del modello, limita la lunghezza delle risposte e attiva la modalità di risparmio energetico per le attività non urgenti.
- Modello copiato che non si carica (air-gap)
- La copia era parziale: mancavano blob o manifest. Copia di nuovo l'intera cartella .ollama/models.
- Memoria insufficiente
- Il modello supera la capacità della tua RAM/VRAM. Scegli una dimensione inferiore o una quantizzazione più leggera (Q4_K_M anziché Q8_0).
#Per approfondire
Un'IA offline si basa sugli stessi fondamenti di un'installazione locale classica. Queste guide del sito completano la preparazione:
- Installare Ollama
- Per installare il motore di inferenza: è il passaggio da eseguire mentre hai ancora una connessione di rete.
- Eseguire un LLM in locale senza GPU (solo CPU)
- Indispensabile per l'uso in mobilità: modelli e velocità attese quando usi solo la CPU con alimentazione a batteria.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per trovare un compromesso tra dimensione su disco, memoria e qualità in base alla macchina che porti con te.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.