Installare un LLM in locale: la guida passo passo (2026)
Installare un LLM in locale richiede tre cose: una macchina con RAM o VRAM sufficiente per la dimensione del modello desiderata, uno strumento per eseguirlo — LM Studio senza terminale, Ollama da riga di comando o llama.cpp per gli esperti — e un primo modello quantizzato adatto a quell’hardware. Calcola dai 10 ai 15 minuti per avere una prima chat locale funzionante su una macchina recente; dopo aver scaricato il modello, non serve più una connessione a Internet.
Vuoi far girare un'IA direttamente sul tuo PC o Mac, ma tutti i nomi di strumenti e modelli si somigliano e non sai da dove cominciare? Questa guida offre la panoramica che manca prima di scegliere: verificare che la tua macchina sia all'altezza, confrontare i tre metodi di installazione, individuare il tuo primo modello ed evitare gli errori che rovinano il primo tentativo. Ogni passaggio rimanda a una guida dedicata più dettagliata, se vuoi approfondire un punto specifico.
#Verificare la propria macchina: RAM, VRAM e dimensione del modello
Prima di scegliere uno strumento, la domanda davvero importante è: quanta memoria della tua macchina puoi dedicare a un modello? Un modello «7B» o «32B» indica il numero di parametri, ma è la sua versione quantizzata — compressa per entrare in memoria, con una lieve perdita di precisione — a determinare lo spazio effettivamente necessario. La quantizzazione Q4 (spesso indicata come Q4_K_M) è il compromesso standard per iniziare: riduce notevolmente la memoria necessaria rispetto ai pesi nativi del modello, con una perdita di qualità generalmente poco percepibile nell’uso.
- 8 GB di RAM, senza GPU dedicata
- modelli leggeri intorno a 3-4B in Q4: uso di base, risposte più lente ma funzionali.
- 16 GB di RAM (CPU) o 8 GB di VRAM (GPU)
- il punto di partenza più comodo, con modelli da 7-8B in Q4 — il formato più comune per un primo vero utilizzo.
- 12 GB di VRAM
- Spazio per salire fino a un modello 14B senza problemi particolari.
- 24 GB di VRAM (o 32-48 GB di memoria unificata su Mac)
- Un modello da 32B con quantizzazione Q4 gira agevolmente.
- 64 GB e oltre di RAM o memoria unificata
- i modelli intorno ai 70B diventano utilizzabili, con un offload parziale tra CPU e GPU e una velocità di generazione nettamente inferiore.
#Scegliere il proprio metodo: LM Studio, Ollama o llama.cpp
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Tre grandi strade permettono di far funzionare un LLM localmente. Non si escludono a vicenda, ma partono da filosofie diverse — la scelta dipende soprattutto dalla tua familiarità con il terminale e da ciò che intendi fare con il modello una volta installato.
- LM Studio — senza terminale
- applicazione desktop con interfaccia grafica completa, ricerca di modelli integrata e impostazioni della GPU accessibili tramite interfaccia grafica. La scelta più diretta per un primo approccio, disponibile su Windows, macOS (Apple Silicon) e Linux.
- Ollama — terminale e API
- installazione con un solo comando, libreria di modelli gestita da riga di comando, server API locale compatibile con OpenAI attivo per impostazione predefinita. La scelta naturale se intendi scrivere script, automatizzare o collegare uno strumento di terze parti.
- llama.cpp — per gli esperti
- Il motore di inferenza che molti altri strumenti usano in background, tra cui LM Studio. Compilazione dai sorgenti, controllo preciso di ogni parametro, nessuna interfaccia — riservato a chi vuole capire o ottimizzare ogni dettaglio.
In sintesi: non vuoi aprire alcun terminale → LM Studio. Vuoi richiamare il modello da uno script, un’automazione o un’applicazione → Ollama. Vuoi capire o modificare ogni parametro di compilazione, oppure eseguire il modello su hardware insolito → llama.cpp.
#Installazione rapida, passo dopo passo
Ecco una versione sintetica dell’installazione per ciascuno dei tre percorsi. L’obiettivo è offrire una panoramica per iniziare in pochi minuti; per ogni strumento c’è una guida dedicata con tutti i dettagli, comprese le schermate.
Con LM Studio (senza usare il terminale):
- 011. Scaricare l'installatoreDal sito ufficiale di LM Studio, scarica la versione corrispondente al tuo sistema.
- 022. Aprire la ricerca dei modelliAl primo avvio, apri la scheda di ricerca (scorciatoia Ctrl/Cmd+Maiusc+M) per esplorare il catalogo.
- 033. Scegliere un modello adattoL'applicazione mostra una stima di compatibilità VRAM prima del download: preferisci un modello contrassegnato come compatibile con la tua macchina.
- 044. Caricare il modello e avviare una conversazioneApri la scheda Chat, carica il modello scaricato dal menu in alto e poni la tua prima domanda.
Con Ollama (terminale e API) :
- 011. Installare OllamaScript ufficiale sotto Linux, installer .exe o .dmg sotto Windows e macOS. L'applicazione desktop si avvia automaticamente dopo l'installazione.
- 022. Avviare un primo modelloIn un terminale, il comando ollama run suivie con il nome di un modello lo scarica e avvia subito un chat direttamente nel terminale.
- 033. Conversare o collegare uno strumento di terze partiContinua nel terminale, oppure configura un'applicazione compatibile con OpenAI in modo che si colleghi al server API locale (porta 11434 per impostazione predefinita).
- 044. Gestione dei modelli installatiElenca, cambia o elimina i tuoi modelli in qualsiasi momento con i comandi di gestione dedicati.
Con llama.cpp (esperti):
- 011. Compilare il binarioClona il repository e compila per il tuo hardware (CPU, CUDA, Metal o ROCm a seconda della tua configurazione).
- 022. Scaricare un modello GGUFScarica un file in formato GGUF da Hugging Face, scegliendo la quantizzazione adatta alla memoria che hai a disposizione.
- 033. Avviare l'eseguibile della chatSpecifica il percorso del file GGUF scaricato, con i parametri di contesto e di offload sulla GPU che preferisci.
- 044. Regolare l'offload GPU/CPURegola con precisione, livello per livello, la distribuzione tra GPU e CPU per trovare il miglior compromesso tra velocità e memoria sulla tua configurazione.
#Scaricare il primo modello
La scelta del primo modello dipende soprattutto da ciò che la tua macchina può contenere comodamente in memoria, non dalla reputazione del modello. Ecco alcuni riferimenti affidabili in base alla tua configurazione.
- Macchina modesta (8-16 GB di RAM, senza GPU dedicata)
- un piccolo modello generalista da circa 3-4B in Q4: veloce anche usando solo la CPU, più che sufficiente per conversare, riassumere o tradurre un testo breve.
- 8-12 GB di VRAM
- un modello 7-8B in Q4_K_M, come Qwen3 8B o Mistral: il compromesso qualità/velocità più comune per un uso quotidiano.
- 16-24 GB di VRAM
- un modello 14B, oppure un 32B in Q4 se sei nella parte alta di questa fascia, come Gemma nella sua versione più grande: più margine per il ragionamento o la programmazione.
- Non sai ancora cosa vuoi farne
- inizia con un modello piccolo. Bastano pochi minuti per verificare che un modello leggero risponda correttamente; passerai a uno più grande quando il primo test avrà dato risultati soddisfacenti.
#Errori comuni da evitare
La maggior parte delle prime impressioni negative sull'IA locale deriva da una configurazione sbagliata piuttosto che da un vero problema con lo strumento o il modello. Ecco le insidie più comuni per chi installa il suo primo LLM in locale e come riconoscerle rapidamente.
- Modello troppo grande per la VRAM
- il modello si riversa nella RAM di sistema e può persino andare in crash durante il caricamento. Le risposte diventano molto lente oppure compare un errore di memoria. Passa a un modello di taglia inferiore oppure scendi di un livello di quantizzazione.
- Quantizzazione scelta a caso
- Scaricare la versione più pesante disponibile «per avere il meglio» porta spesso a ritrovarsi con un modello che non entra in memoria. Parti da Q4_K_M e passa a un livello superiore solo se il margine di memoria lo consente davvero.
- Ventola che gira al massimo e risposta lenta
- normale quando si usa per la prima volta un modello di grandi dimensioni: l'inferenza impegna intensamente la GPU o la CPU. Se è troppo lenta per i tuoi gusti, è il segno che il modello è sovradimensionato per la tua macchina, non un bug da correggere.
- Scaricare tutto prima di provare
- è meglio verificare che un piccolo modello funzioni e risponda correttamente prima di avviare il download di un modello da diverse decine di GB.
#E poi? RAG, assistente di codice, API
Una volta installato e reso funzionante un primo modello, si aprono diversi percorsi naturali in base al tuo utilizzo: conversare con i tuoi documenti, collegare un copilota di programmazione al tuo editor o rendere il server API locale accessibile ai tuoi script e alle tue applicazioni.
- Parlare con i tuoi documenti (RAG)
- LM Studio offre un RAG integrato pronto all'uso. Con Ollama, è necessario associare uno strumento di terze parti come Open WebUI o una pipeline dedicata per ottenere un risultato equivalente.
- Usare un assistente nel tuo editor di codice
- Il server API compatibile con OpenAI di Ollama o di LM Studio può essere collegato a estensioni come Cline per codificare con assistenza del 100% locale.
- Automatizzare tramite l'API
- i due strumenti espongono un server locale compatibile con OpenAI, riutilizzabile in qualsiasi script o applicazione già pensata per questa API, senza dover modificare il lato client.
#Domande frequenti
Installare un LLM localmente è legale e gratuito?+
Qual è la configurazione minima per iniziare?+
È possibile installare un LLM localmente senza scheda grafica?+
Quanto spazio su disco bisogna prevedere?+
Quale modello scegliere per iniziare?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.