Principiante 8 minConcetti

Distillazione: come i piccoli modelli ereditano dai gros

Probabilmente ti sei imbattuto in nomi come DeepSeek-R1-Distill-Qwen-14B e ti sei chiesto perché un modello «piccolo» ragioni all'improvviso quasi altrettanto bene quanto un gigante. La risposta sta in una parola: la distillazione. È la tecnica che permette a un modello compatto di ereditare il comportamento di un modello molto più grande, senza averne le dimensioni né la lentezza. Questa guida spiega la distillazione degli LLM attraverso l'immagine del professore e dell'allievo, descrive in dettaglio ciò che viene realmente trasmesso, ciò che si perde lungo il percorso e come riconoscere una distillazione riuscita prima di farla girare sul tuo sistema.

Di Clara M.·Agg. 2026-08-07·Testato su Windows, macOS e Linux

#Il problema che la distillazione risolve

I migliori modelli aperti sono enormi: diverse centinaia di miliardi di parametri. Sono brillanti, ma inutilizzabili su un computer di fascia consumer: richiedono decine di gigabyte di VRAM e generano testo lentamente. Al contrario, un modello da 7B o 14B trova spazio su una scheda grafica da gaming e risponde velocemente, ma spesso gli manca la finezza di ragionamento del fratello maggiore.

Vorremmo quindi recuperare parte delle capacità di un grande modello in un formato che possa essere eseguito in locale. La reazione ingenua sarebbe semplicemente riaddestrare un modello piccolo sugli stessi dati grezzi del modello grande. Non basta: con dimensioni ridotte, imparare da solo da un oceano di testo produce un modello discreto, ma non eccezionale. La distillazione propone una scorciatoia: invece di imparare di nuovo il mondo da zero, il modello piccolo impara direttamente da quello grande.

i
L'intuizione in una frase
La distillazione non consiste nel comprimere un modello grande. Consiste nell'addestrare un modello piccolo a imitare le risposte e lo stile di ragionamento di uno grande — come un apprendista che osserva il maestro lavorare.

#Il principio maestro-allievo

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La distillazione coinvolge due modelli. Il « maestro » è il modello grande e molto performante che si vuole imitare. L'« allievo » è il modello piccolo che viene addestrato. Il principio: si pongono migliaia di domande al maestro, si raccolgono le sue risposte e si addestra l'allievo a produrre le stesse. L'allievo non impara più da testi grezzi trovati sul web, ma da esempi già « masticati » da un modello esperto.

Il dettaglio che fa tutta la differenza è ciò che l'allievo copia esattamente. Nella versione più ricca, non imita soltanto la parola finale scelta dal docente, ma l'intera distribuzione di probabilità sulla parola successiva: il docente non dice solo «la risposta è gatto», ma indica «gatto molto probabile, cane un po', tostapane quasi impossibile». Queste sfumature — a volte chiamate soft labels — contengono informazioni che la sola risposta corretta non fornisce.

Professore (teacher)
Il grande modello di riferimento, costoso ma eccellente. Serve come fonte; non viene messo in funzione sul tuo sistema.
Allievo (student)
Il piccolo modello che viene addestrato a riprodurre il comportamento dell'insegnante. È questo il modello che eseguirai in locale.
Soft label
Le probabilità assegnate dall'insegnante a ogni possibile parola, con tutte le loro sfumature, non solo alla parola vincente. La materia prima più ricca della distillazione.
Set di distillazione
Tutte le domande poste e le risposte del docente, sulle quali lo studente si esercita.
→
Un'immagine mentale
Uno studente può imparare da solo leggendo libri, oppure seguire il miglior insegnante del paese, che gli mostra non solo la risposta corretta, ma anche il proprio ragionamento, le proprie esitazioni e ciò che scarta. Nel secondo caso, lo studente progredisce molto più velocemente a parità di impegno. La distillazione consiste nell'offrire quel professore al piccolo modello.

#Quello che si trasmette veramente

Spesso si pensa che la distillazione «trasferisca le conoscenze» dal modello più grande. È in parte vero, ma impreciso. A trasferirsi meglio sono soprattutto i comportamenti e i modi di procedere, più che i fatti in sé. Un modello piccolo ha una capacità di memorizzazione limitata: non può ricordare tutto ciò che contiene l'enciclopedia interna di un gigante. Può però apprendere molto bene dei metodi.

Stile di ragionamento
Il modo di suddividere un problema in fasi, di formulare una catena di pensiero prima di concludere. È ciò che si trasmette meglio, e il cuore dei R1-Distill.
Il formato delle risposte
La struttura, il tono, il modo di organizzare una spiegazione o del codice. L'allievo adotta le abitudini redazionali del docente.
Gli schemi di risoluzione
In matematica, nella programmazione o nella logica, l'allievo eredita metodi collaudati: come affrontare un tipo di problema, quali verifiche effettuare.
Una parte delle conoscenze
Fatti e associazioni, sì, ma entro i limiti della capacità del piccolo modello. È l'aspetto che si trasferisce meno bene.

Questa distinzione è essenziale per capire i modelli distillati recenti. Quando DeepSeek distilla R1 in un Qwen 14B, l'obiettivo non è far entrare tutte le conoscenze generali di R1 in 14 miliardi di parametri: è impossibile. L'obiettivo è trasmettere il suo modo di ragionare: riflettere passo dopo passo, correggersi, sviluppare una dimostrazione. E questo un piccolo modello può impararlo molto bene.

i
Comportamento vs conoscenza
Tieni presente questa regola: la distillazione trasmette soprattutto competenze e abitudini (come pensare), meno fatti grezzi (cosa sapere). Un modello distillato può ragionare come un gigante pur conoscendo meno cose di lui.

#Perché un 14B distillato supera un 14B classico

Ecco la parte controintuitiva. Due modelli hanno esattamente la stessa dimensione — 14 miliardi di parametri — quindi la stessa VRAM e la stessa velocità. Eppure il modello distillato spesso surclassa quello classico nel ragionamento. La dimensione non è cambiata; è cambiato solo il metodo di addestramento. Come può lo stesso numero di parametri produrre un modello molto migliore?

Perché l'addestramento non riempie i parametri a caso: li organizza. Un 14B classico impara da solo a partire da testo grezzo; sviluppa capacità discrete ma generaliste. Un 14B distillato impara da esempi prodotti da un insegnante d'élite, spesso con ragionamenti completi sviluppati passo dopo passo. I suoi 14 miliardi di parametri si strutturano intorno a buoni metodi anziché a un po' di tutto. A parità di capacità, la qualità del segnale di addestramento fa la differenza.

Stesso costo, segnale migliore
Il modello distillato non è né più grande né più lento, ma ha appreso da materiale di qualità molto superiore: gli output di un esperto.
Esempi densi
Le risposte del professore sono ricche di ragionamenti corretti e completi, rari nel testo grezzo del web.
Meno rumore
Il web contiene molti errori e materiale disordinato. Un insegnante filtra: lo studente impara su materiale ripulito.

Attenzione a non interpretare queste affermazioni in modo eccessivo: «battere» vale soprattutto per i compiti su cui si concentra la distillazione, tipicamente il ragionamento, la matematica e il codice. Per la pura cultura generale o le conoscenze fattuali dettagliate, il divario si riduce e può persino invertirsi. Un modello distillato non è magicamente superiore in tutto: è superiore negli ambiti in cui è stato addestrato a esserlo.

#Il caso dei R1-Distill

L'esempio che ha reso popolare la distillazione per l'uso locale è la famiglia DeepSeek-R1-Distill, uscita all'inizio del 2025. DeepSeek ha usato il suo grande modello di ragionamento R1 come insegnante e ne ha distillato il comportamento in diversi allievi di dimensioni diverse, basati su architetture esistenti come Qwen e Llama. Risultato: modelli da 1.5B, 7B, 8B, 14B e 32B che ragionano con una catena di pensiero visibile, una capacità che prima era riservata ai giganti.

R1-Distill-Qwen-1.5B
Minuscolo, funziona praticamente ovunque, anche senza GPU. Sorprendente per le sue dimensioni nella matematica semplice.
R1-Distill-Qwen-7B / Llama-8B
Compromesso per il grande pubblico: circa 5 GB in Q4, su una scheda da 8 GB. Buon ragionamento per un uso quotidiano.
R1-Distill-Qwen-14B
≈ 9 GB in Q4, adatto a una RTX 3060 da 12 GB o a una 4070 da 12 GB. Il compromesso ideale tra capacità di ragionamento e hardware accessibile.
R1-Distill-Qwen-32B
≈ 19 GB in Q4, per una RTX 4090 da 24 GB. Il più vicino al modello insegnante, se la tua VRAM lo permette.

Questi modelli mostrano la loro catena di pensiero tra tag di riflessione prima di fornire la risposta finale. È proprio il comportamento del modello insegnante R1 a essere stato trasmesso. In pratica, un R1-Distill-Qwen-14B sviluppa un ragionamento strutturato su un problema di matematica, mentre un Qwen 14B classico risponderebbe in modo meno articolato — a parità di memoria occupata.

!
Un modello distillato non è «il vero R1»
Un DeepSeek-R1-Distill-Qwen-14B non è R1 in versione ridotta: è un Qwen 14B che ha imparato a ragionare come R1. Ne ha il metodo, ma non tutta la potenza né tutte le conoscenze. Non aspettarti le prestazioni del modello completo da 671B.

#I limiti: ciò che non si trasmette

La distillazione ha un limite imposto dalla dimensione dell'allievo. Non si può versare l'oceano di un gigante in un ditale. Capire ciò che si perde lungo il percorso evita delusioni e scelte sbagliate del modello.

La conoscenza fattuale dettagliata
Il modello piccolo non può memorizzare tutto ciò che sa il docente. Su fatti specifici o di nicchia, tende a inventare più facilmente.
La robustezza su argomenti diversi
Su compiti lontani da ciò che è stato distillato, l'allievo torna più o meno al livello di un modello classico delle stesse dimensioni.
Il limite di capacità
Un 7B distillato resta un 7B. La distillazione ottimizza l'uso dei parametri, non ne aggiunge.
Coerenza su un contesto molto lungo
Seguire un ragionamento su decine di migliaia di token rimane più difficile per un modello piccolo, sia esso distillato o no.

C'è anche un rischio più sottile: un modello distillato può imitare la forma del ragionamento del modello insegnante senza averne sempre la correttezza. «Fa come se ragionasse» in modo convincente, ma può sbagliare con sicurezza su un problema al di fuori della sua portata. Una bella catena di pensiero non è una garanzia di esattezza — è un aspetto da verificare sempre, soprattutto per decisioni importanti.

i
L'approccio giusto
Usa un modello distillato per ciò che sa fare bene — ragionare, strutturare, scrivere codice — e mantieni uno sguardo critico sui fatti che afferma. Per l'affidabilità fattuale, un RAG che lo supporti con i tuoi documenti è meglio della sola memoria del modello.

#Riconoscere una buona distillazione

Non tutti i modelli distillati si equivalgono. Prima di scaricarne uno, alcuni indizi permettono di valutarne seriamente la qualità, senza essere esperti.

Un insegnante identificato
Una buona scheda indica chiaramente il modello insegnante (es. «distillato da R1»). Un modello insegnante di buona reputazione è un buon segnale iniziale.
Una base chiara
Su quale architettura è costruito il modello allievo (Qwen, Llama…)? Una base solida e ben supportata facilita l'uso locale.
Benchmark mirati
Guarda i punteggi sui compiti che ti interessano (matematica, programmazione, ragionamento), non un dato complessivo vago. E confronta con il modello non distillato delle stesse dimensioni.
Coerenza tra dimensione e promessa
Diffida di un modello piccolissimo venduto come equivalente a un gigante in tutto. La distillazione aiuta, ma non fa miracoli.
Formato di riflessione
Per un modello di ragionamento distillato, verifica che mostri effettivamente la propria catena di pensiero e che questa sia pertinente, non soltanto decorativa.
→
Il test che non ti inganna
Scarica SIA il modello distillato SIA il modello classico della stessa dimensione e poni a entrambi le tue domande difficili, confrontando le risposte fianco a fianco. Se il modello distillato ragiona meglio sui tuoi casi reali, fa al caso tuo — un risultato molto più indicativo di un benchmark pubblico.

#I principali modelli distillati da provare in locale

Ecco i modelli distillati che vale la pena considerare nel 2026, dal più leggero al più esigente, con il loro ingombro indicativo in memoria in Q4_K_M.

DeepSeek-R1-Distill-Qwen-1.5B
≈ 1,5 GB. La scommessa sul minuscolo: funziona anche su CPU o su un piccolo portatile. Sorprendente in matematica per le sue dimensioni.
DeepSeek-R1-Distill-Qwen-7B
≈ 5 GB, su una scheda da 8 GB. Il punto di partenza ideale per scoprire il ragionamento distillato nell'uso quotidiano.
DeepSeek-R1-Distill-Qwen-14B
≈ 9 GB, adatto a una RTX 3060 da 12 GB o a una 4070. Il miglior rapporto ragionamento/hardware tra le opzioni accessibili.
DeepSeek-R1-Distill-Qwen-32B
≈ 19 GB, per una RTX 4090 da 24 GB. Il più vicino al modello insegnante, se la tua VRAM lo permette.

Se sei agli inizi, comincia dalla versione 7B o 14B: mostrano i vantaggi della distillazione su una sola scheda consumer, senza la complessità delle configurazioni più grandi. La 1.5B è un ottimo ambiente di sperimentazione per capire il comportamento di ragionamento anche senza GPU.

#Provare un modello distillato in 3 minuti

Se Ollama è già installato ed è in ascolto sulla porta predefinita (http://localhost:11434), bastano due comandi per farsi un’idea di ciò che offre la distillazione rispetto a un modello classico delle stesse dimensioni.

  1. 01
    Scaricare e avviare un modello distillato
    Recupera un R1-Distill e parlagli. Il primo avvio scarica il modello (alcuni GB a seconda della dimensione scelta).
  2. 02
    Porre un problema di ragionamento
    Dagli un problema di matematica o di logica in più passaggi. Osserva la sua catena di pensiero: sviluppa un ragionamento prima di arrivare a una conclusione.
  3. 03
    Confrontare con il modello non distillato
    Avvia il Qwen classico delle stesse dimensioni e poni la stessa domanda. Il modello distillato dovrebbe ragionare in modo più strutturato, a parità di VRAM e velocità.
Terminale
# Lancer un modèle distillé de raisonnement
ollama run deepseek-r1:14b

# Comparer avec le modèle classique de même taille
ollama run qwen3:14b
i
Vedi il ragionamento
Con un R1-Distill, la risposta inizia con una fase di riflessione (catena di pensiero) prima della conclusione. È precisamente il comportamento ereditato dal modello insegnante R1: il segno visibile che la distillazione ha fatto il suo lavoro.

#Per approfondire

La distillazione si comprende meglio collegandola agli altri concetti di base dell'IA locale. Queste guide approfondiscono direttamente gli argomenti trattati in questa guida:

Installare DeepSeek R1 con Ollama
Procedimento passo passo per eseguire localmente le versioni distillate 7B/14B/32B, con i requisiti di VRAM in funzione della dimensione.
MoE spiegato: perché un 30B-A3B gira come un modello piccolo
L'altro grande accorgimento architetturale che rende i modelli di grandi dimensioni accessibili in locale, complementare alla distillazione.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Una volta scelto il tuo modello distillato, la quantizzazione determina quanta memoria occuperà sulla tua scheda.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.