Principiante 8 minOffline

Un'IA offline: usare un LLM senza connessione internet

Un LLM locale ha bisogno di internet solo per essere scaricato. Una volta che il modello è sul tuo disco, un'IA offline funziona interamente senza connessione: in aereo, in una zona senza copertura, durante un'escursione o su un computer isolato dalla rete. Questa guida mostra come preparare la tua macchina prima di partire, quali modelli compatti portare con te e come verificare tutto per non ritrovarti bloccato al momento sbagliato.

Di Léa B.·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché un'IA offline

Gli assistenti cloud (ChatGPT, Claude, Gemini) si fermano di colpo appena cade la connessione. Un'IA offline, invece, funziona interamente sul tuo computer: il modello è caricato in memoria e calcola le risposte localmente, senza mai interrogare un server remoto. È lo stesso principio di un LLM locale classico, portato alla sua logica conclusione: nessuna dipendenza dalla rete una volta completata la preparazione.

Le situazioni in cui questo cambia tutto sono più frequenti di quanto si creda: un volo a lungo raggio, un viaggio in treno senza 4G, una missione in una zona senza copertura di rete, un cantiere o un sito industriale senza Wi-Fi, oppure una postazione volutamente disconnessa da internet per motivi di riservatezza. In tutti questi casi, un'IA offline ben preparata rimane pienamente operativa.

Autonomia totale
Nessuna interruzione quando la rete si interrompe: aereo, tunnel, campagna, sotterraneo.
Privacy
Nulla esce dalla macchina. Ideale per dati sensibili o una postazione air-gapped.
Nessun costo ricorrente
Nessun abbonamento, nessuna fatturazione per token, nessuna quota.
Latenza stabile
La velocità dipende solo dal tuo hardware, non da un server sovraccarico all'altro capo del mondo.

#Ciò che ha bisogno della rete (e ciò che non ne ha bisogno)

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Capire la differenza tra « online » e « offline » evita brutte sorprese. Una sola fase richiede internet: il download. Tutto il resto è locale.

Serve la rete (una volta)
Scaricare l'applicazione (Ollama, LM Studio), scaricare i modelli (file GGUF), recuperare gli aggiornamenti.
100 % offline
Caricare un modello già presente, conversare, generare testo o codice, riassumere un documento locale, usare un RAG sui tuoi file.
i
La trappola classica
Molti strumenti tentano di verificare la disponibilità di aggiornamenti o di eseguire un «pull» automatico all'avvio. Senza rete, questo non impedisce il funzionamento purché il modello sia già stato scaricato, ma l'app può mostrare un errore fuorviante. Prova sempre in modalità aereo PRIMA di partire.

#Prerequisiti prima di partire

Un'IA offline può funzionare su un normale computer portatile. Ciò che conta è la RAM (o la VRAM se hai una GPU) e lo spazio su disco per memorizzare i modelli.

Spazio libero sul disco
Prevedere da 5 a 30 GB in base ai modelli integrati. Un modello 7B in Q4_K_M pesa circa 4,5 GB, un 14B circa 9 GB.
RAM / VRAM
8 GB per un modello 3B, 16 GB per usare comodamente un 7B, 32 GB per puntare a un 14B. Valori di riferimento per la VRAM in Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
GPU (opzionale)
Una GPU accelera molto ma non è obbligatoria. Un MacBook Apple Silicon (serie M) o un PC con 16 GB di RAM sono sufficienti anche usando solo la CPU.
Batteria
L'inferenza impegna la CPU/GPU: su un portatile scollegato dall'alimentazione, aspettati un'autonomia ridotta. Preferisci modelli compatti quando sei in mobilità.
→
Senza GPU, funziona comunque
In aereo o in treno, spesso userai solo la CPU. Un modello da 3B o 7B in Q4_K_M rimane fluido su un laptop recente. La guida «LLM in locale senza GPU» descrive in dettaglio i modelli e le velocità attese.

#Scaricare tutto prima di perdere la connessione

È la fase decisiva e l'unica che richiede internet. Completala con calma a casa o in ufficio, tramite Wi-Fi, qualche ora prima della partenza: un modello di diversi GB non ama le connessioni instabili. Ecco la procedura da seguire con Ollama, l'approccio più semplice per un'IA offline.

  1. 01
    Installare Ollama mentre hai una connessione a Internet
    Scarica e installa Ollama dal sito ollama.com. È il daemon che farà funzionare i tuoi modelli localmente, in ascolto su http://localhost:11434. Installalo prima di tutto, perché l'app stessa viene scaricata online.
  2. 02
    Scaricare uno o due modelli compatti
    Usa ollama pull per scaricare i modelli sul disco. Scegli dimensioni adatte alla tua macchina (vedi sezione successiva). Un pull con una connessione Wi-Fi stabile richiede da pochi minuti a un quarto d'ora, a seconda della velocità di trasferimento e delle dimensioni.
  3. 03
    Installare un'interfaccia grafica (opzionale)
    Se preferisci una finestra di chat a un terminale, installa LM Studio (tutto in uno, gestisce anche il download) o Open WebUI. LM Studio è particolarmente pratico in mobilità: app + modelli + interfaccia in un solo strumento.
  4. 04
    Eseguire una prova con ogni modello una volta
    Avvia una conversazione di prova con ogni modello scaricato mentre hai ancora una connessione di rete. Questo conferma che il file è completo e si carica correttamente in memoria.
Terminale — preparazione (con accesso alla rete)
# Vérifier qu'Ollama est bien installé
ollama --version

# Télécharger des modèles compacts pour la mobilité
ollama pull qwen3.5:2b         # ~1,9 Go, très léger
ollama pull qwen3.5:9b         # ~6,6 Go, LE polyvalent 2026
ollama pull granite4.2:8b      # ~5,3 Go, sobre et token-efficient

# Lister ce qui est déjà sur le disque
ollama list
!
Non partire con un pull completato solo a metà
Un ollama pull interrompu lascia un modello incompleto che rifiuterà di caricarsi offline. Aspetta il messaggio «success» e conferma la presenza del modello con ollama list prima di interrompere la connessione.

#I modelli compatti che bastano per l'uso in mobilità

Quando usi un portatile offline, l'efficienza energetica viene prima di tutto: un modello piccolo e veloce che consuma poca batteria è meglio di un mastodonte che arranca e la scarica. Per la maggior parte degli usi in mobilità — scrittura, riassunti, domande generali, assistenza alla programmazione — un modello da 2B a 9B in Q4_K_M svolge molto bene il lavoro.

Qwen 3.5 2B
~1,9 GB. Il più leggero: ideale per un vecchio laptop o per risparmiare la batteria. Multimodale, 256k di contesto, licenza Apache 2.0. Abbastanza per scrivere, riformulare, rispondere a domande semplici.
Qwen 3.5 9B
~6,6 GB. Eccellente modello versatile, valido nel ragionamento, nella visione e nella programmazione, con un contesto di 256k. Il miglior compromesso per un laptop con 16 GB di RAM — la scelta di riferimento per 8 GB nel 2026.
Granite 4.2 8B
~5,3 GB. Parco nei consumi ed efficiente nell'uso dei token (IBM, Apache 2.0), 128k di contesto, risposte concise. Una scelta affidabile per la scrittura che preserva la batteria.
Granite 4.2 3B
~2,2 GB. Compatto e veloce, molto parsimonioso nell'uso delle risorse, pensato per macchine modeste pur mantenendo buone capacità.
→
Porta due modelli, non dieci
Un piccolo (2-3B) per risparmiare la batteria e rispondere velocemente, un medio (8-9B) per compiti più impegnativi. È sufficiente per coprire il 95% dei bisogni offline senza saturare il disco.

La quantizzazione Q4_K_M è l'impostazione predefinita consigliata: riduce notevolmente la dimensione del modello e la memoria necessaria, con una perdita di qualità minima e impercettibile nella maggior parte degli usi. Se hai margine in RAM/VRAM e cerchi un po' più di precisione, Q5_K_M è un'alternativa. Riserva Q8_0 e FP16 alle macchine con risorse molto abbondanti.


#Verificare che tutto funzioni veramente offline

Non fidarti mai sulla parola: prova in condizioni reali prima di trovarti senza rete. Un test di tre minuti evita una delusione a 10.000 metri d'altitudine.

  1. 01
    Disconnettere completamente la macchina dalla rete
    Attiva la modalità aereo, disattiva SIA il Wi-Fi SIA l'Ethernet. L'obiettivo è riprodurre esattamente l'assenza totale di connessione.
  2. 02
    Avviare una conversazione
    Apri il terminale o LM Studio e parla con ogni modello scaricato. Se il modello risponde, la tua IA offline è funzionante.
  3. 03
    Controllare che nessun errore di rete impedisca il funzionamento
    Alcune interfacce mostrano un banner di avviso quando sono offline: finché la generazione funziona, ignoralo. Se la chat si rifiuta di avviarsi, probabilmente il modello non era stato completamente scaricato.
Terminale — test offline (modalità aereo attivata)
# Le daemon tourne en local, aucun réseau requis
ollama run qwen3.5:9b "Résume en trois points les avantages d'une IA hors ligne."

# Vérifier que le serveur local répond bien sur son port par défaut
curl http://localhost:11434/api/tags
i
Il server rimane locale
Ollama ascolta su http://localhost:11434, un indirizzo interno alla tua macchina. Non ha niente a che fare con internet: funziona allo stesso modo con o senza connessione.

#Postazione isolata e uso air-gapped

Alcune macchine sono mantenute intenzionalmente scollegate da Internet in modo permanente: postazioni che elaborano dati riservati, ambienti industriali, laboratori. È l'uso «air-gapped»: la macchina di destinazione non avrà mai accesso alla rete, nemmeno per l'installazione.

Il principio: preparare i file su una macchina connessa, poi trasferirli tramite chiavetta USB o disco esterno al computer isolato. Ollama conserva i suoi modelli in una cartella che puoi copiare così com'è.

Installatori offline
Scarica il binario di installazione di Ollama o di LM Studio da una macchina connessa, poi copialo sul computer isolato.
File dei modelli
Su Linux/macOS, i modelli Ollama si trovano in ~/.ollama/models; su Windows, in %USERPROFILE%\.ollama\models. Copia questa cartella sul computer di destinazione nello stesso percorso.
Alternativa GGUF
Con LM Studio, basta copiare i file .gguf scaricati nella cartella dei modelli dell'app sulla macchina isolata.
Terminale — trasferimento su un computer isolato
# Sur la machine connectée : localiser les modèles
ls ~/.ollama/models

# Copier tout le dossier .ollama vers une clé USB
cp -r ~/.ollama /media/usb/ollama-backup

# Sur le poste air-gapped : restaurer au même emplacement
cp -r /media/usb/ollama-backup ~/.ollama

# Vérifier que les modèles sont bien reconnus
ollama list
!
Copia completa obbligatoria
La cartella models contiene sia i blob (i pesi) sia i manifest (i metadati). Copia l'intera cartella: un manifest senza il suo blob, o viceversa, rende il modello inutilizzabile sul computer di destinazione.

#Aggiornare i tuoi modelli appena torni online

Una volta tornato in una zona coperta, è il momento di mantenere aggiornata la tua installazione: recuperare le nuove versioni dei modelli, aggiungere nuovi modelli scoperti durante il percorso e aggiornare l'applicazione. Niente di tutto questo si può fare offline, per cui è importante farlo appena torna la connessione.

  1. 01
    Aggiornare i modelli esistenti
    Un ollama pull sur un modello già presente scarica solo le layer modificate se esiste una nuova versione. È veloce e mantiene i tuoi modelli aggiornati.
  2. 02
    Aggiornare l'applicazione
    Esegui di nuovo il programma di installazione di Ollama o LM Studio per beneficiare delle correzioni e del supporto per nuovi modelli. Gli aggiornamenti sono frequenti in questo ecosistema.
  3. 03
    Fare pulizia
    Elimina i modelli che non utilizzi più per liberare spazio su disco prima del tuo prossimo viaggio.
  4. 04
    Riprovare in modalità aereo
    Dopo ogni aggiornamento, ripeti un test offline: una nuova versione dell'app potrebbe introdurre un comportamento imprevisto in assenza di rete.
Terminal — manutenzione (con connessione di rete)
# Mettre à jour un modèle vers sa dernière version
ollama pull qwen3.5:9b

# Supprimer un modèle devenu inutile
ollama rm qwen3.5:2b

# Voir l'espace occupé par chaque modèle
ollama list

#Risoluzione dei problemi

« Model not found » offline
Il modello non era (completamente) stato scaricato prima della interruzione. Riconnetti, riavvia ollama pull jusqu al messaggio successo, poi verifica con ollama list.
L'app rifiuta di avviarsi senza rete
Alcune interfacce tentano una verifica online all'avvio. Aspetta qualche secondo che la verifica vada in timeout, oppure disattiva il controllo degli aggiornamenti nelle impostazioni.
Risposte molto lente quando sei in viaggio
Usando solo la CPU e con alimentazione a batteria, è normale. Passa a un modello più piccolo (3B) e chiudi le applicazioni che consumano molte risorse. Collega il portatile alla corrente, se possibile.
Batteria che si scarica a vista d'occhio
L'inferenza sollecita molto il processore. Riduci le dimensioni del modello, limita la lunghezza delle risposte e attiva la modalità di risparmio energetico per le attività non urgenti.
Modello copiato che non si carica (air-gap)
La copia era parziale: mancavano blob o manifest. Copia di nuovo l'intera cartella .ollama/models.
Memoria insufficiente
Il modello supera la capacità della tua RAM/VRAM. Scegli una dimensione inferiore o una quantizzazione più leggera (Q4_K_M anziché Q8_0).

#Per approfondire

Un'IA offline si basa sugli stessi fondamenti di un'installazione locale classica. Queste guide del sito completano la preparazione:

Installare Ollama
Per installare il motore di inferenza: è il passaggio da eseguire mentre hai ancora una connessione di rete.
Eseguire un LLM in locale senza GPU (solo CPU)
Indispensabile per l'uso in mobilità: modelli e velocità attese quando usi solo la CPU con alimentazione a batteria.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per trovare un compromesso tra dimensione su disco, memoria e qualità in base alla macchina che porti con te.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.