LLM: cos'è? Definizione semplice e fonctionnement
Che cos'è esattamente un LLM? In una frase: un programma che ha letto una quantità enorme di testo e che, a partire da ciò che ha imparato, predice la parola successiva più plausibile — e così via, fino a formare una risposta. Questo manuale spiega senza gergo come viene addestrato un grande modello linguistico, come genera testo token per token, e la differenza tra un LLM cloud (ChatGPT, Gemini) e un LLM locale che puoi eseguire sulla tua macchina.
#Che cosa è un LLM? La definizione semplice
LLM è l'acronimo di Large Language Model, in francese «grand modèle de langage». La parola «large» (grande) si riferisce alle dimensioni: questi modelli contengono miliardi di parametri, una sorta di impostazioni numeriche regolate durante l'apprendimento. «Language model» (modello linguistico) significa che il programma modella il linguaggio: ha imparato quanto sia probabile una determinata sequenza di parole in una determinata situazione.
In pratica, un LLM fa una sola cosa: a partire da un pezzo di testo, predice ciò che viene dopo. Scrivi «La capitale della Francia è» e il modello calcola che la parola più probabile dopo questa frase è «Parigi». Tutta la magia apparente di un assistente come ChatGPT deriva da questo meccanismo ripetuto migliaia di volte: scrivere un'email, riassumere un documento o scrivere del codice non è altro che una lunga sequenza di «qual è la parola successiva più probabile?».
#I token: come un LLM legge e scrive
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Un LLM non vede parole né lettere come noi. Lavora con token: frammenti di testo. Un token può essere una parola breve intera (« chat »), una parte di parola (« anti », « constitution »), un segno di punteggiatura o uno spazio. In media, in francese, un token corrisponde all'incirca a 3 o 4 caratteri, cioè circa ¾ di una parola.
Prima di elaborare il tuo messaggio, il modello lo divide in token (si chiama tokenizzazione), poi trasforma ogni token in una lista di numeri. Tutto ciò che calcola, lo calcola su questi numeri. Quando risponde, genera un token alla volta, poi li riconverte in testo leggibile. È per questo che si parla di generazione «token per token».
- Token
- L'unità di base elaborata dal modello: una parola breve, una parte di parola o un simbolo.
- Contesto
- La quantità di token che il modello può «tenere a mente» contemporaneamente (domanda + cronologia + risposta). Si parla di finestra di contesto, spesso di 4.000, 32.000 o addirittura centinaia di migliaia di token.
- Riferimento pratico
- Una pagina di testo ≈ 500–700 token. 1.000 token ≈ 750 parole. La fatturazione cloud e la velocità locale si misurano entrambe in token.
#L'addestramento: come un LLM impara
Un LLM non è programmato regola per regola. È addestrato. Gli si presentano enormi volumi di testo (pagine web, libri, codice, articoli) e gli si chiede, in ogni punto, di indovinare la parola successiva. All'inizio, sbaglia quasi sempre. A ogni errore, un algoritmo regola leggermente i suoi miliardi di parametri affinché la previsione successiva sia un po' migliore. Ripetuto miliardi di volte, questo processo fa emergere una comprensione statistica della grammatica, dei fatti e del ragionamento.
Questa fase si svolge in due grandi tappe. Il pre-addestramento costruisce la cultura generale del modello a partire dal testo grezzo. Poi un affinamento (fine-tuning) e un allineamento gli insegnano a seguire istruzioni e a rispondere in modo utile e cortese, spesso con l'aiuto di feedback umani. Un modello «instruct» o «chat» è stato sottoposto a questa seconda tappa; è quello che si usa per conversare.
- Parametri (i « miliardi »)
- Le impostazioni interne regolate durante l'addestramento. Un modello « 7B » ha 7 miliardi di parametri, un « 70B » ne ha 70 miliardi. Più parametri ci sono, maggiori sono le sue capacità — e maggiore è la memoria richiesta.
- Pesi (weights)
- L'altro nome dei parametri, una volta fissati. Scaricare un modello significa scaricare i suoi pesi: un grosso file di diversi gigabyte.
- Dati di addestramento
- Il testo letto durante l'apprendimento. Il modello non lo «archivia» parola per parola: ne conserva regolarità statistiche.
#L'inferenza: generare testo token per token
Una volta addestrato il modello, il suo utilizzo si chiama inferenza. Invii un testo (il prompt) e il modello produce la sua risposta un token alla volta. Ecco il ciclo esatto: legge tutto il testo disponibile, calcola il token successivo più probabile, lo aggiunge alla sequenza, rilegge tutto — prompt + il nuovo token — e ricomincia. Si ferma quando genera un token speciale di fine o raggiunge il limite fissato.
Per questo, in un'interfaccia di chat, la risposta viene visualizzata parola per parola in tempo reale: assisti letteralmente alla generazione. La velocità si misura in token al secondo. Con un LLM locale, dipende dal tuo hardware: una buona GPU genera decine di token al secondo, un processore da solo molti meno.
Il modello non sceglie sempre il token più probabile in modo rigido. Un parametro chiamato temperatura introduce una componente di casualità controllata: quando è bassa, le risposte sono prevedibili e fattuali; quando è alta, sono più creative e varie. È lo stesso meccanismo che spiega perché un LLM possa dare due risposte diverse alla stessa domanda.
#Cosa non è un LLM
Capire il funzionamento evita i malintesi comuni. Un LLM non è una base di dati: non cerca una risposta memorizzata, la ricostruisce statisticamente. Non è connesso a internet per impostazione predefinita: conosce soltanto ciò che ha letto fino alla data di addestramento, a meno che non gli venga collegato uno strumento di ricerca o un sistema RAG. E non «capisce» nel senso umano: modella il linguaggio estremamente bene, il che basta per essere utile, ma si tratta pur sempre di una previsione, non di una coscienza.
#LLM in cloud vs LLM locale: la vera differenza
Esistono due modi per utilizzare un LLM. Nel caso di un LLM cloud, il modello viene eseguito sui server di un'azienda (OpenAI per ChatGPT, Google per Gemini, Anthropic per Claude). Invii il tuo testo via internet, le loro GPU calcolano la risposta e te la restituiscono. Non scarichi nulla; in cambio, i tuoi dati transitano attraverso una terza parte e dipendi da un abbonamento e da una connessione.
Nel caso di un LLM locale, scarichi i pesi di un modello open-weight (Llama, Qwen, Mistral, Gemma…) e lo esegui sul tuo computer. L'inferenza avviene interamente sul tuo dispositivo: nessun dato esce, nessun abbonamento, funziona anche senza connessione. Il rovescio della medaglia è che serve hardware adeguato e che i migliori modelli aperti rimangono spesso un passo indietro rispetto ai più grandi modelli cloud proprietari.
- Privacy
- Cloud: i tuoi prompt vanno al fornitore. Locale: tutto rimane sulla tua macchina.
- Costo
- Cloud: abbonamento mensile o pagamento per token. In locale: uso gratuito una volta acquistato l'hardware.
- Offline
- Cloud: connessione obbligatoria. Locale: funziona senza internet una volta scaricato il modello.
- Potenza
- Cloud: accesso ai modelli più grandi senza bisogno di hardware. In locale: limitato dalla tua GPU/RAM, ma già molto capace con una scheda da 12 GB.
- Controllo
- Cloud: il fornitore può cambiare il modello o le regole. Locale: il modello è tuo e non cambia senza il tuo accordo.
#Perché esiste un LLM locale
Se il cloud è così pratico, perché eseguire un LLM sul proprio computer? Tre ragioni principali. La privacy prima di tutto: documenti medici, contratti, codice proprietario, note personali — molti utenti e aziende rifiutano di inviare questi contenuti su server esterni. L'indipendenza poi: nessun abbonamento, nessun limite di messaggi, nessuna interruzione se il servizio cambia prezzo o scompare. E il controllo tecnico: un modello locale si configura, si integra con i propri strumenti e funziona in aereo come in zona senza rete.
Ciò che ha reso tutto questo possibile è la quantizzazione: una tecnica che comprime i pesi del modello affinché rientrino nella memoria disponibile senza perdere troppo in qualità. Grazie a questa tecnica, un modello che richiedeva un server può ora funzionare su un PC da gaming. Il formato Q4_K_M è il compromesso consigliato per iniziare; Q5_K_M, Q8_0 e FP16 offrono maggiore precisione al costo di un maggiore utilizzo di memoria.
#Provare un LLM a casa in 10 minuti
Il modo migliore per capire un LLM è avviarne uno. Lo stack più semplice è composto da due parti: Ollama, un daemon che scarica ed esegue i modelli (è in ascolto su http://localhost:11434), e un'interfaccia come Open WebUI o LM Studio per conversare in una finestra di chat. Ecco il percorso minimo da riga di comando, con un piccolo modello che funziona anche senza una GPU dedicata.
- 01Installare OllamaScarica il programma di installazione da ollama.com per Windows, macOS o Linux e avvialo. Una volta installato, Ollama funziona in background ed espone la sua API locale sulla porta 11434.
- 02Scaricare e avviare un modelloUn unico comando recupera i pesi e poi apre la chat direttamente nel terminale. Il primo avvio scarica alcuni gigabyte; quelli successivi sono istantanei.
- 03DiscutereFai una domanda e osserva la risposta apparire token per token: vedi l'inferenza in tempo reale. Digita /bye per uscire dalla conversazione.
- 04Verificare che tutto sia localeDisattiva il Wi-Fi e fai di nuovo una domanda. Il modello continua a rispondere: è la prova che il calcolo avviene al 100% sulla tua macchina.
#Per approfondire
Ora sai cos'è un LLM e come funziona. Queste guide approfondiscono ogni concetto trattato qui:
- Iniziare con Ollama
- «Ollama: che cos'è e come funziona» descrive in dettaglio l'installazione, i comandi di base (run, pull, list) e l'hardware necessario per iniziare.
- Capire i token
- «Capire la finestra di contesto» spiega come il modello «vede» i tuoi messaggi e perché dimentica le conversazioni lunghe.
- Scegliere la quantizzazione
- «Scegliere la quantizzazione (Q4, Q5, Q8, FP16)» aiuta a trovare il giusto equilibrio tra qualità e memoria per la tua scheda.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.