Principiante 12 minInstallazione

Installare un LLM in locale: la guida passo passo (2026)

Risposta diretta

Installare un LLM in locale richiede tre cose: una macchina con RAM o VRAM sufficiente per la dimensione del modello desiderata, uno strumento per eseguirlo — LM Studio senza terminale, Ollama da riga di comando o llama.cpp per gli esperti — e un primo modello quantizzato adatto a quell’hardware. Calcola dai 10 ai 15 minuti per avere una prima chat locale funzionante su una macchina recente; dopo aver scaricato il modello, non serve più una connessione a Internet.

Vuoi far girare un'IA direttamente sul tuo PC o Mac, ma tutti i nomi di strumenti e modelli si somigliano e non sai da dove cominciare? Questa guida offre la panoramica che manca prima di scegliere: verificare che la tua macchina sia all'altezza, confrontare i tre metodi di installazione, individuare il tuo primo modello ed evitare gli errori che rovinano il primo tentativo. Ogni passaggio rimanda a una guida dedicata più dettagliata, se vuoi approfondire un punto specifico.

Di Mohamed Meguedmi·Agg. 2026-08-24·Testato su Windows, macOS e Linux

#Verificare la propria macchina: RAM, VRAM e dimensione del modello

Prima di scegliere uno strumento, la domanda davvero importante è: quanta memoria della tua macchina puoi dedicare a un modello? Un modello «7B» o «32B» indica il numero di parametri, ma è la sua versione quantizzata — compressa per entrare in memoria, con una lieve perdita di precisione — a determinare lo spazio effettivamente necessario. La quantizzazione Q4 (spesso indicata come Q4_K_M) è il compromesso standard per iniziare: riduce notevolmente la memoria necessaria rispetto ai pesi nativi del modello, con una perdita di qualità generalmente poco percepibile nell’uso.

8 GB di RAM, senza GPU dedicata
modelli leggeri intorno a 3-4B in Q4: uso di base, risposte più lente ma funzionali.
16 GB di RAM (CPU) o 8 GB di VRAM (GPU)
il punto di partenza più comodo, con modelli da 7-8B in Q4 — il formato più comune per un primo vero utilizzo.
12 GB di VRAM
Spazio per salire fino a un modello 14B senza problemi particolari.
24 GB di VRAM (o 32-48 GB di memoria unificata su Mac)
Un modello da 32B con quantizzazione Q4 gira agevolmente.
64 GB e oltre di RAM o memoria unificata
i modelli intorno ai 70B diventano utilizzabili, con un offload parziale tra CPU e GPU e una velocità di generazione nettamente inferiore.
i
Sono solo riferimenti, non garanzie
La lunghezza del contesto utilizzata, il sistema operativo e le altre applicazioni aperte fanno variare il margine effettivamente disponibile. Mantieni sempre un margine di circa il 20–30% oltre lo spazio occupato dal solo modello prima di considerare una configurazione confortevole.

#Scegliere il proprio metodo: LM Studio, Ollama o llama.cpp

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Tre grandi strade permettono di far funzionare un LLM localmente. Non si escludono a vicenda, ma partono da filosofie diverse — la scelta dipende soprattutto dalla tua familiarità con il terminale e da ciò che intendi fare con il modello una volta installato.

LM Studio — senza terminale
applicazione desktop con interfaccia grafica completa, ricerca di modelli integrata e impostazioni della GPU accessibili tramite interfaccia grafica. La scelta più diretta per un primo approccio, disponibile su Windows, macOS (Apple Silicon) e Linux.
Ollama — terminale e API
installazione con un solo comando, libreria di modelli gestita da riga di comando, server API locale compatibile con OpenAI attivo per impostazione predefinita. La scelta naturale se intendi scrivere script, automatizzare o collegare uno strumento di terze parti.
llama.cpp — per gli esperti
Il motore di inferenza che molti altri strumenti usano in background, tra cui LM Studio. Compilazione dai sorgenti, controllo preciso di ogni parametro, nessuna interfaccia — riservato a chi vuole capire o ottimizzare ogni dettaglio.

In sintesi: non vuoi aprire alcun terminale → LM Studio. Vuoi richiamare il modello da uno script, un’automazione o un’applicazione → Ollama. Vuoi capire o modificare ogni parametro di compilazione, oppure eseguire il modello su hardware insolito → llama.cpp.


#Installazione rapida, passo dopo passo

Ecco una versione sintetica dell’installazione per ciascuno dei tre percorsi. L’obiettivo è offrire una panoramica per iniziare in pochi minuti; per ogni strumento c’è una guida dedicata con tutti i dettagli, comprese le schermate.

Con LM Studio (senza usare il terminale):

  1. 01
    1. Scaricare l'installatore
    Dal sito ufficiale di LM Studio, scarica la versione corrispondente al tuo sistema.
  2. 02
    2. Aprire la ricerca dei modelli
    Al primo avvio, apri la scheda di ricerca (scorciatoia Ctrl/Cmd+Maiusc+M) per esplorare il catalogo.
  3. 03
    3. Scegliere un modello adatto
    L'applicazione mostra una stima di compatibilità VRAM prima del download: preferisci un modello contrassegnato come compatibile con la tua macchina.
  4. 04
    4. Caricare il modello e avviare una conversazione
    Apri la scheda Chat, carica il modello scaricato dal menu in alto e poni la tua prima domanda.

Con Ollama (terminale e API) :

  1. 01
    1. Installare Ollama
    Script ufficiale sotto Linux, installer .exe o .dmg sotto Windows e macOS. L'applicazione desktop si avvia automaticamente dopo l'installazione.
  2. 02
    2. Avviare un primo modello
    In un terminale, il comando ollama run suivie con il nome di un modello lo scarica e avvia subito un chat direttamente nel terminale.
  3. 03
    3. Conversare o collegare uno strumento di terze parti
    Continua nel terminale, oppure configura un'applicazione compatibile con OpenAI in modo che si colleghi al server API locale (porta 11434 per impostazione predefinita).
  4. 04
    4. Gestione dei modelli installati
    Elenca, cambia o elimina i tuoi modelli in qualsiasi momento con i comandi di gestione dedicati.

Con llama.cpp (esperti):

  1. 01
    1. Compilare il binario
    Clona il repository e compila per il tuo hardware (CPU, CUDA, Metal o ROCm a seconda della tua configurazione).
  2. 02
    2. Scaricare un modello GGUF
    Scarica un file in formato GGUF da Hugging Face, scegliendo la quantizzazione adatta alla memoria che hai a disposizione.
  3. 03
    3. Avviare l'eseguibile della chat
    Specifica il percorso del file GGUF scaricato, con i parametri di contesto e di offload sulla GPU che preferisci.
  4. 04
    4. Regolare l'offload GPU/CPU
    Regola con precisione, livello per livello, la distribuzione tra GPU e CPU per trovare il miglior compromesso tra velocità e memoria sulla tua configurazione.
i
Per i dettagli completi
Ognuna di queste tre strade merita una propria guida passo passo, con screenshot e opzioni avanzate. Questa versione condensata basta per ottenere un primo modello che risponde; torna alla guida dedicata appena vuoi approfondire un punto specifico, come il supporto per le GPU AMD o la configurazione di rete di un server.

#Scaricare il primo modello

La scelta del primo modello dipende soprattutto da ciò che la tua macchina può contenere comodamente in memoria, non dalla reputazione del modello. Ecco alcuni riferimenti affidabili in base alla tua configurazione.

Macchina modesta (8-16 GB di RAM, senza GPU dedicata)
un piccolo modello generalista da circa 3-4B in Q4: veloce anche usando solo la CPU, più che sufficiente per conversare, riassumere o tradurre un testo breve.
8-12 GB di VRAM
un modello 7-8B in Q4_K_M, come Qwen3 8B o Mistral: il compromesso qualità/velocità più comune per un uso quotidiano.
16-24 GB di VRAM
un modello 14B, oppure un 32B in Q4 se sei nella parte alta di questa fascia, come Gemma nella sua versione più grande: più margine per il ragionamento o la programmazione.
Non sai ancora cosa vuoi farne
inizia con un modello piccolo. Bastano pochi minuti per verificare che un modello leggero risponda correttamente; passerai a uno più grande quando il primo test avrà dato risultati soddisfacenti.
→
Il nome della quantizzazione non è un dettaglio puramente estetico
Un tag come Q4_K_M, Q5_K_M o Q8_0 indica il livello di compressione del modello. Più il numero è basso, più il modello è leggero e veloce, ma meno preciso. Q4_K_M rimane il punto di partenza migliore per un primo test.

#Errori comuni da evitare

La maggior parte delle prime impressioni negative sull'IA locale deriva da una configurazione sbagliata piuttosto che da un vero problema con lo strumento o il modello. Ecco le insidie più comuni per chi installa il suo primo LLM in locale e come riconoscerle rapidamente.

Modello troppo grande per la VRAM
il modello si riversa nella RAM di sistema e può persino andare in crash durante il caricamento. Le risposte diventano molto lente oppure compare un errore di memoria. Passa a un modello di taglia inferiore oppure scendi di un livello di quantizzazione.
Quantizzazione scelta a caso
Scaricare la versione più pesante disponibile «per avere il meglio» porta spesso a ritrovarsi con un modello che non entra in memoria. Parti da Q4_K_M e passa a un livello superiore solo se il margine di memoria lo consente davvero.
Ventola che gira al massimo e risposta lenta
normale quando si usa per la prima volta un modello di grandi dimensioni: l'inferenza impegna intensamente la GPU o la CPU. Se è troppo lenta per i tuoi gusti, è il segno che il modello è sovradimensionato per la tua macchina, non un bug da correggere.
Scaricare tutto prima di provare
è meglio verificare che un piccolo modello funzioni e risponda correttamente prima di avviare il download di un modello da diverse decine di GB.

#E poi? RAG, assistente di codice, API

Una volta installato e reso funzionante un primo modello, si aprono diversi percorsi naturali in base al tuo utilizzo: conversare con i tuoi documenti, collegare un copilota di programmazione al tuo editor o rendere il server API locale accessibile ai tuoi script e alle tue applicazioni.

Parlare con i tuoi documenti (RAG)
LM Studio offre un RAG integrato pronto all'uso. Con Ollama, è necessario associare uno strumento di terze parti come Open WebUI o una pipeline dedicata per ottenere un risultato equivalente.
Usare un assistente nel tuo editor di codice
Il server API compatibile con OpenAI di Ollama o di LM Studio può essere collegato a estensioni come Cline per codificare con assistenza del 100% locale.
Automatizzare tramite l'API
i due strumenti espongono un server locale compatibile con OpenAI, riutilizzabile in qualsiasi script o applicazione già pensata per questa API, senza dover modificare il lato client.
→
Un passo alla volta
Non serve puntare al RAG, al copilota di codice e all'automazione fin dal primo giorno. Verifica prima che una chat locale risponda correttamente alle tue domande; gli usi più avanzati si sviluppano naturalmente una volta consolidata questa base.

#Domande frequenti

Installare un LLM localmente è legale e gratuito?+
Sì: gli strumenti come Ollama, LM Studio o llama.cpp sono gratuiti, e i modelli open-weights (Llama, Qwen, Mistral, Gemma...) sono pubblicati sotto licenze che consentono l'uso personale. Alcune licenze hanno condizioni specifiche per l'uso commerciale su larga scala, da verificare caso per caso sulla pagina del modello.
Qual è la configurazione minima per iniziare?+
In pratica, 16 GB di RAM e un processore recente sono sufficienti per un primo modello di alcuni miliardi di parametri. Una GPU con almeno 8 GB di VRAM, o un chip Apple Silicon con abbastanza memoria unificata, rende l'esperienza decisamente più comoda quando passi a modelli più grandi.
È possibile installare un LLM localmente senza scheda grafica?+
Sì, i tre metodi illustrati qui funzionano usando esclusivamente la CPU. I modelli da 3 a 8B restano utilizzabili senza GPU, ma le risposte sono più lente rispetto a quelle ottenute con una scheda dedicata.
Quanto spazio su disco bisogna prevedere?+
Ogni modello quantizzato pesa da alcune centinaia di MB per i più piccoli a diverse decine di GB per i più grandi. Prevedi un ampio margine di spazio su un SSD se intendi provare diversi modelli prima di scegliere quello da usare.
Quale modello scegliere per iniziare?+
Un modello generalista da 7 a 8B, come Qwen3 8B o Mistral, con quantizzazione Q4_K_M, è un solido punto di partenza sulla maggior parte delle macchine recenti. Adatta poi le dimensioni in base alla RAM o VRAM effettivamente disponibile e ai tuoi primi test.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.