Distillazione: come i piccoli modelli ereditano dai gros
Probabilmente ti sei imbattuto in nomi come DeepSeek-R1-Distill-Qwen-14B e ti sei chiesto perché un modello «piccolo» ragioni all'improvviso quasi altrettanto bene quanto un gigante. La risposta sta in una parola: la distillazione. È la tecnica che permette a un modello compatto di ereditare il comportamento di un modello molto più grande, senza averne le dimensioni né la lentezza. Questa guida spiega la distillazione degli LLM attraverso l'immagine del professore e dell'allievo, descrive in dettaglio ciò che viene realmente trasmesso, ciò che si perde lungo il percorso e come riconoscere una distillazione riuscita prima di farla girare sul tuo sistema.
#Il problema che la distillazione risolve
I migliori modelli aperti sono enormi: diverse centinaia di miliardi di parametri. Sono brillanti, ma inutilizzabili su un computer di fascia consumer: richiedono decine di gigabyte di VRAM e generano testo lentamente. Al contrario, un modello da 7B o 14B trova spazio su una scheda grafica da gaming e risponde velocemente, ma spesso gli manca la finezza di ragionamento del fratello maggiore.
Vorremmo quindi recuperare parte delle capacità di un grande modello in un formato che possa essere eseguito in locale. La reazione ingenua sarebbe semplicemente riaddestrare un modello piccolo sugli stessi dati grezzi del modello grande. Non basta: con dimensioni ridotte, imparare da solo da un oceano di testo produce un modello discreto, ma non eccezionale. La distillazione propone una scorciatoia: invece di imparare di nuovo il mondo da zero, il modello piccolo impara direttamente da quello grande.
#Il principio maestro-allievo
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La distillazione coinvolge due modelli. Il « maestro » è il modello grande e molto performante che si vuole imitare. L'« allievo » è il modello piccolo che viene addestrato. Il principio: si pongono migliaia di domande al maestro, si raccolgono le sue risposte e si addestra l'allievo a produrre le stesse. L'allievo non impara più da testi grezzi trovati sul web, ma da esempi già « masticati » da un modello esperto.
Il dettaglio che fa tutta la differenza è ciò che l'allievo copia esattamente. Nella versione più ricca, non imita soltanto la parola finale scelta dal docente, ma l'intera distribuzione di probabilità sulla parola successiva: il docente non dice solo «la risposta è gatto», ma indica «gatto molto probabile, cane un po', tostapane quasi impossibile». Queste sfumature — a volte chiamate soft labels — contengono informazioni che la sola risposta corretta non fornisce.
- Professore (teacher)
- Il grande modello di riferimento, costoso ma eccellente. Serve come fonte; non viene messo in funzione sul tuo sistema.
- Allievo (student)
- Il piccolo modello che viene addestrato a riprodurre il comportamento dell'insegnante. È questo il modello che eseguirai in locale.
- Soft label
- Le probabilità assegnate dall'insegnante a ogni possibile parola, con tutte le loro sfumature, non solo alla parola vincente. La materia prima più ricca della distillazione.
- Set di distillazione
- Tutte le domande poste e le risposte del docente, sulle quali lo studente si esercita.
#Quello che si trasmette veramente
Spesso si pensa che la distillazione «trasferisca le conoscenze» dal modello più grande. È in parte vero, ma impreciso. A trasferirsi meglio sono soprattutto i comportamenti e i modi di procedere, più che i fatti in sé. Un modello piccolo ha una capacità di memorizzazione limitata: non può ricordare tutto ciò che contiene l'enciclopedia interna di un gigante. Può però apprendere molto bene dei metodi.
- Stile di ragionamento
- Il modo di suddividere un problema in fasi, di formulare una catena di pensiero prima di concludere. È ciò che si trasmette meglio, e il cuore dei R1-Distill.
- Il formato delle risposte
- La struttura, il tono, il modo di organizzare una spiegazione o del codice. L'allievo adotta le abitudini redazionali del docente.
- Gli schemi di risoluzione
- In matematica, nella programmazione o nella logica, l'allievo eredita metodi collaudati: come affrontare un tipo di problema, quali verifiche effettuare.
- Una parte delle conoscenze
- Fatti e associazioni, sì, ma entro i limiti della capacità del piccolo modello. È l'aspetto che si trasferisce meno bene.
Questa distinzione è essenziale per capire i modelli distillati recenti. Quando DeepSeek distilla R1 in un Qwen 14B, l'obiettivo non è far entrare tutte le conoscenze generali di R1 in 14 miliardi di parametri: è impossibile. L'obiettivo è trasmettere il suo modo di ragionare: riflettere passo dopo passo, correggersi, sviluppare una dimostrazione. E questo un piccolo modello può impararlo molto bene.
#Perché un 14B distillato supera un 14B classico
Ecco la parte controintuitiva. Due modelli hanno esattamente la stessa dimensione — 14 miliardi di parametri — quindi la stessa VRAM e la stessa velocità. Eppure il modello distillato spesso surclassa quello classico nel ragionamento. La dimensione non è cambiata; è cambiato solo il metodo di addestramento. Come può lo stesso numero di parametri produrre un modello molto migliore?
Perché l'addestramento non riempie i parametri a caso: li organizza. Un 14B classico impara da solo a partire da testo grezzo; sviluppa capacità discrete ma generaliste. Un 14B distillato impara da esempi prodotti da un insegnante d'élite, spesso con ragionamenti completi sviluppati passo dopo passo. I suoi 14 miliardi di parametri si strutturano intorno a buoni metodi anziché a un po' di tutto. A parità di capacità, la qualità del segnale di addestramento fa la differenza.
- Stesso costo, segnale migliore
- Il modello distillato non è né più grande né più lento, ma ha appreso da materiale di qualità molto superiore: gli output di un esperto.
- Esempi densi
- Le risposte del professore sono ricche di ragionamenti corretti e completi, rari nel testo grezzo del web.
- Meno rumore
- Il web contiene molti errori e materiale disordinato. Un insegnante filtra: lo studente impara su materiale ripulito.
Attenzione a non interpretare queste affermazioni in modo eccessivo: «battere» vale soprattutto per i compiti su cui si concentra la distillazione, tipicamente il ragionamento, la matematica e il codice. Per la pura cultura generale o le conoscenze fattuali dettagliate, il divario si riduce e può persino invertirsi. Un modello distillato non è magicamente superiore in tutto: è superiore negli ambiti in cui è stato addestrato a esserlo.
#Il caso dei R1-Distill
L'esempio che ha reso popolare la distillazione per l'uso locale è la famiglia DeepSeek-R1-Distill, uscita all'inizio del 2025. DeepSeek ha usato il suo grande modello di ragionamento R1 come insegnante e ne ha distillato il comportamento in diversi allievi di dimensioni diverse, basati su architetture esistenti come Qwen e Llama. Risultato: modelli da 1.5B, 7B, 8B, 14B e 32B che ragionano con una catena di pensiero visibile, una capacità che prima era riservata ai giganti.
- R1-Distill-Qwen-1.5B
- Minuscolo, funziona praticamente ovunque, anche senza GPU. Sorprendente per le sue dimensioni nella matematica semplice.
- R1-Distill-Qwen-7B / Llama-8B
- Compromesso per il grande pubblico: circa 5 GB in Q4, su una scheda da 8 GB. Buon ragionamento per un uso quotidiano.
- R1-Distill-Qwen-14B
- ≈ 9 GB in Q4, adatto a una RTX 3060 da 12 GB o a una 4070 da 12 GB. Il compromesso ideale tra capacità di ragionamento e hardware accessibile.
- R1-Distill-Qwen-32B
- ≈ 19 GB in Q4, per una RTX 4090 da 24 GB. Il più vicino al modello insegnante, se la tua VRAM lo permette.
Questi modelli mostrano la loro catena di pensiero tra tag di riflessione prima di fornire la risposta finale. È proprio il comportamento del modello insegnante R1 a essere stato trasmesso. In pratica, un R1-Distill-Qwen-14B sviluppa un ragionamento strutturato su un problema di matematica, mentre un Qwen 14B classico risponderebbe in modo meno articolato — a parità di memoria occupata.
#I limiti: ciò che non si trasmette
La distillazione ha un limite imposto dalla dimensione dell'allievo. Non si può versare l'oceano di un gigante in un ditale. Capire ciò che si perde lungo il percorso evita delusioni e scelte sbagliate del modello.
- La conoscenza fattuale dettagliata
- Il modello piccolo non può memorizzare tutto ciò che sa il docente. Su fatti specifici o di nicchia, tende a inventare più facilmente.
- La robustezza su argomenti diversi
- Su compiti lontani da ciò che è stato distillato, l'allievo torna più o meno al livello di un modello classico delle stesse dimensioni.
- Il limite di capacità
- Un 7B distillato resta un 7B. La distillazione ottimizza l'uso dei parametri, non ne aggiunge.
- Coerenza su un contesto molto lungo
- Seguire un ragionamento su decine di migliaia di token rimane più difficile per un modello piccolo, sia esso distillato o no.
C'è anche un rischio più sottile: un modello distillato può imitare la forma del ragionamento del modello insegnante senza averne sempre la correttezza. «Fa come se ragionasse» in modo convincente, ma può sbagliare con sicurezza su un problema al di fuori della sua portata. Una bella catena di pensiero non è una garanzia di esattezza — è un aspetto da verificare sempre, soprattutto per decisioni importanti.
#Riconoscere una buona distillazione
Non tutti i modelli distillati si equivalgono. Prima di scaricarne uno, alcuni indizi permettono di valutarne seriamente la qualità, senza essere esperti.
- Un insegnante identificato
- Una buona scheda indica chiaramente il modello insegnante (es. «distillato da R1»). Un modello insegnante di buona reputazione è un buon segnale iniziale.
- Una base chiara
- Su quale architettura è costruito il modello allievo (Qwen, Llama…)? Una base solida e ben supportata facilita l'uso locale.
- Benchmark mirati
- Guarda i punteggi sui compiti che ti interessano (matematica, programmazione, ragionamento), non un dato complessivo vago. E confronta con il modello non distillato delle stesse dimensioni.
- Coerenza tra dimensione e promessa
- Diffida di un modello piccolissimo venduto come equivalente a un gigante in tutto. La distillazione aiuta, ma non fa miracoli.
- Formato di riflessione
- Per un modello di ragionamento distillato, verifica che mostri effettivamente la propria catena di pensiero e che questa sia pertinente, non soltanto decorativa.
#I principali modelli distillati da provare in locale
Ecco i modelli distillati che vale la pena considerare nel 2026, dal più leggero al più esigente, con il loro ingombro indicativo in memoria in Q4_K_M.
- DeepSeek-R1-Distill-Qwen-1.5B
- ≈ 1,5 GB. La scommessa sul minuscolo: funziona anche su CPU o su un piccolo portatile. Sorprendente in matematica per le sue dimensioni.
- DeepSeek-R1-Distill-Qwen-7B
- ≈ 5 GB, su una scheda da 8 GB. Il punto di partenza ideale per scoprire il ragionamento distillato nell'uso quotidiano.
- DeepSeek-R1-Distill-Qwen-14B
- ≈ 9 GB, adatto a una RTX 3060 da 12 GB o a una 4070. Il miglior rapporto ragionamento/hardware tra le opzioni accessibili.
- DeepSeek-R1-Distill-Qwen-32B
- ≈ 19 GB, per una RTX 4090 da 24 GB. Il più vicino al modello insegnante, se la tua VRAM lo permette.
Se sei agli inizi, comincia dalla versione 7B o 14B: mostrano i vantaggi della distillazione su una sola scheda consumer, senza la complessità delle configurazioni più grandi. La 1.5B è un ottimo ambiente di sperimentazione per capire il comportamento di ragionamento anche senza GPU.
#Provare un modello distillato in 3 minuti
Se Ollama è già installato ed è in ascolto sulla porta predefinita (http://localhost:11434), bastano due comandi per farsi un’idea di ciò che offre la distillazione rispetto a un modello classico delle stesse dimensioni.
- 01Scaricare e avviare un modello distillatoRecupera un R1-Distill e parlagli. Il primo avvio scarica il modello (alcuni GB a seconda della dimensione scelta).
- 02Porre un problema di ragionamentoDagli un problema di matematica o di logica in più passaggi. Osserva la sua catena di pensiero: sviluppa un ragionamento prima di arrivare a una conclusione.
- 03Confrontare con il modello non distillatoAvvia il Qwen classico delle stesse dimensioni e poni la stessa domanda. Il modello distillato dovrebbe ragionare in modo più strutturato, a parità di VRAM e velocità.
#Per approfondire
La distillazione si comprende meglio collegandola agli altri concetti di base dell'IA locale. Queste guide approfondiscono direttamente gli argomenti trattati in questa guida:
- Installare DeepSeek R1 con Ollama
- Procedimento passo passo per eseguire localmente le versioni distillate 7B/14B/32B, con i requisiti di VRAM in funzione della dimensione.
- MoE spiegato: perché un 30B-A3B gira come un modello piccolo
- L'altro grande accorgimento architetturale che rende i modelli di grandi dimensioni accessibili in locale, complementare alla distillazione.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Una volta scelto il tuo modello distillato, la quantizzazione determina quanta memoria occuperà sulla tua scheda.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.