Principiante 9 minBasi

LLM: cos'è? Definizione semplice e fonctionnement

Che cos'è esattamente un LLM? In una frase: un programma che ha letto una quantità enorme di testo e che, a partire da ciò che ha imparato, predice la parola successiva più plausibile — e così via, fino a formare una risposta. Questo manuale spiega senza gergo come viene addestrato un grande modello linguistico, come genera testo token per token, e la differenza tra un LLM cloud (ChatGPT, Gemini) e un LLM locale che puoi eseguire sulla tua macchina.

Di Mohamed Meguedmi·Agg. 2026-09-02·Testato su Windows, macOS e Linux

#Che cosa è un LLM? La definizione semplice

LLM è l'acronimo di Large Language Model, in francese «grand modèle de langage». La parola «large» (grande) si riferisce alle dimensioni: questi modelli contengono miliardi di parametri, una sorta di impostazioni numeriche regolate durante l'apprendimento. «Language model» (modello linguistico) significa che il programma modella il linguaggio: ha imparato quanto sia probabile una determinata sequenza di parole in una determinata situazione.

In pratica, un LLM fa una sola cosa: a partire da un pezzo di testo, predice ciò che viene dopo. Scrivi «La capitale della Francia è» e il modello calcola che la parola più probabile dopo questa frase è «Parigi». Tutta la magia apparente di un assistente come ChatGPT deriva da questo meccanismo ripetuto migliaia di volte: scrivere un'email, riassumere un documento o scrivere del codice non è altro che una lunga sequenza di «qual è la parola successiva più probabile?».

i
In un'immagine
Immagina la digitazione predittiva del tuo telefono, ma addestrata su migliaia di miliardi di parole invece dei tuoi SMS. Un LLM è questa tastiera predittiva portata all'estremo — abbastanza potente da sostenere una conversazione coerente.

#I token: come un LLM legge e scrive

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Un LLM non vede parole né lettere come noi. Lavora con token: frammenti di testo. Un token può essere una parola breve intera (« chat »), una parte di parola (« anti », « constitution »), un segno di punteggiatura o uno spazio. In media, in francese, un token corrisponde all'incirca a 3 o 4 caratteri, cioè circa ¾ di una parola.

Prima di elaborare il tuo messaggio, il modello lo divide in token (si chiama tokenizzazione), poi trasforma ogni token in una lista di numeri. Tutto ciò che calcola, lo calcola su questi numeri. Quando risponde, genera un token alla volta, poi li riconverte in testo leggibile. È per questo che si parla di generazione «token per token».

Token
L'unità di base elaborata dal modello: una parola breve, una parte di parola o un simbolo.
Contesto
La quantità di token che il modello può «tenere a mente» contemporaneamente (domanda + cronologia + risposta). Si parla di finestra di contesto, spesso di 4.000, 32.000 o addirittura centinaia di migliaia di token.
Riferimento pratico
Una pagina di testo ≈ 500–700 token. 1.000 token ≈ 750 parole. La fatturazione cloud e la velocità locale si misurano entrambe in token.
→
Perché conta
La finestra del contesto è un limite fisico: se il tuo documento supera la dimensione del contesto, il modello ne vede solo una parte. Capire i token aiuta a capire perché un LLM «dimentica» l'inizio di una conversazione molto lunga.

#L'addestramento: come un LLM impara

Un LLM non è programmato regola per regola. È addestrato. Gli si presentano enormi volumi di testo (pagine web, libri, codice, articoli) e gli si chiede, in ogni punto, di indovinare la parola successiva. All'inizio, sbaglia quasi sempre. A ogni errore, un algoritmo regola leggermente i suoi miliardi di parametri affinché la previsione successiva sia un po' migliore. Ripetuto miliardi di volte, questo processo fa emergere una comprensione statistica della grammatica, dei fatti e del ragionamento.

Questa fase si svolge in due grandi tappe. Il pre-addestramento costruisce la cultura generale del modello a partire dal testo grezzo. Poi un affinamento (fine-tuning) e un allineamento gli insegnano a seguire istruzioni e a rispondere in modo utile e cortese, spesso con l'aiuto di feedback umani. Un modello «instruct» o «chat» è stato sottoposto a questa seconda tappa; è quello che si usa per conversare.

Parametri (i « miliardi »)
Le impostazioni interne regolate durante l'addestramento. Un modello « 7B » ha 7 miliardi di parametri, un « 70B » ne ha 70 miliardi. Più parametri ci sono, maggiori sono le sue capacità — e maggiore è la memoria richiesta.
Pesi (weights)
L'altro nome dei parametri, una volta fissati. Scaricare un modello significa scaricare i suoi pesi: un grosso file di diversi gigabyte.
Dati di addestramento
Il testo letto durante l'apprendimento. Il modello non lo «archivia» parola per parola: ne conserva regolarità statistiche.
i
Addestramento ≠ utilizzo
L'addestramento costa milioni di euro e settimane di calcolo su migliaia di GPU: nessuno lo ripete a casa. Una volta pubblicati i pesi, invece, è possibile usarli (l'inferenza) su un semplice PC. È questa la promessa dei LLM locali.

#L'inferenza: generare testo token per token

Una volta addestrato il modello, il suo utilizzo si chiama inferenza. Invii un testo (il prompt) e il modello produce la sua risposta un token alla volta. Ecco il ciclo esatto: legge tutto il testo disponibile, calcola il token successivo più probabile, lo aggiunge alla sequenza, rilegge tutto — prompt + il nuovo token — e ricomincia. Si ferma quando genera un token speciale di fine o raggiunge il limite fissato.

Per questo, in un'interfaccia di chat, la risposta viene visualizzata parola per parola in tempo reale: assisti letteralmente alla generazione. La velocità si misura in token al secondo. Con un LLM locale, dipende dal tuo hardware: una buona GPU genera decine di token al secondo, un processore da solo molti meno.

Il modello non sceglie sempre il token più probabile in modo rigido. Un parametro chiamato temperatura introduce una componente di casualità controllata: quando è bassa, le risposte sono prevedibili e fattuali; quando è alta, sono più creative e varie. È lo stesso meccanismo che spiega perché un LLM possa dare due risposte diverse alla stessa domanda.

!
Il tranello delle allucinazioni
Un LLM predice ciò che è plausibile, non ciò che è vero. Quando non «sa» qualcosa, genera comunque la sequenza più probabile — che può essere falsa ma formulata con sicurezza. Questo si chiama allucinazione: da tenere sempre presente per i fatti, i numeri e le citazioni.

#Cosa non è un LLM

Capire il funzionamento evita i malintesi comuni. Un LLM non è una base di dati: non cerca una risposta memorizzata, la ricostruisce statisticamente. Non è connesso a internet per impostazione predefinita: conosce soltanto ciò che ha letto fino alla data di addestramento, a meno che non gli venga collegato uno strumento di ricerca o un sistema RAG. E non «capisce» nel senso umano: modella il linguaggio estremamente bene, il che basta per essere utile, ma si tratta pur sempre di una previsione, non di una coscienza.


#LLM in cloud vs LLM locale: la vera differenza

Esistono due modi per utilizzare un LLM. Nel caso di un LLM cloud, il modello viene eseguito sui server di un'azienda (OpenAI per ChatGPT, Google per Gemini, Anthropic per Claude). Invii il tuo testo via internet, le loro GPU calcolano la risposta e te la restituiscono. Non scarichi nulla; in cambio, i tuoi dati transitano attraverso una terza parte e dipendi da un abbonamento e da una connessione.

Nel caso di un LLM locale, scarichi i pesi di un modello open-weight (Llama, Qwen, Mistral, Gemma…) e lo esegui sul tuo computer. L'inferenza avviene interamente sul tuo dispositivo: nessun dato esce, nessun abbonamento, funziona anche senza connessione. Il rovescio della medaglia è che serve hardware adeguato e che i migliori modelli aperti rimangono spesso un passo indietro rispetto ai più grandi modelli cloud proprietari.

Privacy
Cloud: i tuoi prompt vanno al fornitore. Locale: tutto rimane sulla tua macchina.
Costo
Cloud: abbonamento mensile o pagamento per token. In locale: uso gratuito una volta acquistato l'hardware.
Offline
Cloud: connessione obbligatoria. Locale: funziona senza internet una volta scaricato il modello.
Potenza
Cloud: accesso ai modelli più grandi senza bisogno di hardware. In locale: limitato dalla tua GPU/RAM, ma già molto capace con una scheda da 12 GB.
Controllo
Cloud: il fornitore può cambiare il modello o le regole. Locale: il modello è tuo e non cambia senza il tuo accordo.

#Perché esiste un LLM locale

Se il cloud è così pratico, perché eseguire un LLM sul proprio computer? Tre ragioni principali. La privacy prima di tutto: documenti medici, contratti, codice proprietario, note personali — molti utenti e aziende rifiutano di inviare questi contenuti su server esterni. L'indipendenza poi: nessun abbonamento, nessun limite di messaggi, nessuna interruzione se il servizio cambia prezzo o scompare. E il controllo tecnico: un modello locale si configura, si integra con i propri strumenti e funziona in aereo come in zona senza rete.

Ciò che ha reso tutto questo possibile è la quantizzazione: una tecnica che comprime i pesi del modello affinché rientrino nella memoria disponibile senza perdere troppo in qualità. Grazie a questa tecnica, un modello che richiedeva un server può ora funzionare su un PC da gaming. Il formato Q4_K_M è il compromesso consigliato per iniziare; Q5_K_M, Q8_0 e FP16 offrono maggiore precisione al costo di un maggiore utilizzo di memoria.

i
Indicazione della VRAM in Q4
Quanta memoria serve per quale modello? 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Una RTX 3060 12 GB esegue senza difficoltà un 7B o un 14B; una RTX 4090 24 GB o un Mac Apple Silicon 48 GB sono indicati per i modelli più grandi.

#Provare un LLM a casa in 10 minuti

Il modo migliore per capire un LLM è avviarne uno. Lo stack più semplice è composto da due parti: Ollama, un daemon che scarica ed esegue i modelli (è in ascolto su http://localhost:11434), e un'interfaccia come Open WebUI o LM Studio per conversare in una finestra di chat. Ecco il percorso minimo da riga di comando, con un piccolo modello che funziona anche senza una GPU dedicata.

  1. 01
    Installare Ollama
    Scarica il programma di installazione da ollama.com per Windows, macOS o Linux e avvialo. Una volta installato, Ollama funziona in background ed espone la sua API locale sulla porta 11434.
  2. 02
    Scaricare e avviare un modello
    Un unico comando recupera i pesi e poi apre la chat direttamente nel terminale. Il primo avvio scarica alcuni gigabyte; quelli successivi sono istantanei.
  3. 03
    Discutere
    Fai una domanda e osserva la risposta apparire token per token: vedi l'inferenza in tempo reale. Digita /bye per uscire dalla conversazione.
  4. 04
    Verificare che tutto sia locale
    Disattiva il Wi-Fi e fai di nuovo una domanda. Il modello continua a rispondere: è la prova che il calcolo avviene al 100% sulla tua macchina.
Terminale
# Lancer un petit modèle rapide (≈2 Go, tourne même sans GPU)
ollama run llama3.2:3b

# Pour un modèle plus capable si vous avez ~5 Go de VRAM
ollama run qwen3

# Vérifier les modèles installés et que le daemon répond
ollama list
curl http://localhost:11434/api/tags
→
I nomi dei tag evolvono
I tag esatti (llama3.2:3b, qwen3…) e le dimensioni disponibili cambiano regolarmente nel catalogo di Ollama. Consulta ollama.com/library per il nome preciso e le dimensioni in GB di ogni variante prima di scaricarla.

#Per approfondire

Ora sai cos'è un LLM e come funziona. Queste guide approfondiscono ogni concetto trattato qui:

Iniziare con Ollama
«Ollama: che cos'è e come funziona» descrive in dettaglio l'installazione, i comandi di base (run, pull, list) e l'hardware necessario per iniziare.
Capire i token
«Capire la finestra di contesto» spiega come il modello «vede» i tuoi messaggi e perché dimentica le conversazioni lunghe.
Scegliere la quantizzazione
«Scegliere la quantizzazione (Q4, Q5, Q8, FP16)» aiuta a trovare il giusto equilibrio tra qualità e memoria per la tua scheda.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.