Avanzato 14 minFine-tuning

Unsloth: fine-tuning un LLM su una scheda grande public

Risposta diretta

Unsloth è una libreria Python open source (Apache 2.0 per il core, più di 76.000 stelle su GitHub) che riscrive le fasi più onerose del fine-tuning LoRA e QLoRA: fino al doppio della velocità con il 70% di VRAM in meno, secondo il produttore. La sua documentazione indica un minimo di 6 GB per un modello da 8 miliardi di parametri in QLoRA a 4 bit: una scheda da 12 GB è sufficiente, poi l'esportazione in GGUF permette di passare a Ollama.

Unsloth rend il fine-tuning di un modello aperto accessibile su una scheda grafica di uso comune: stesse metodologie, ma nuclei di calcolo riscritti che riducono tempo e memoria necessari. Un modello con 7 o 8 miliardi di parametri si può adattare su una scheda da 12 GB, e il risultato viene esportato in GGUF per funzionare su Ollama. Rimane la domanda che precede tutto: hai veramente bisogno di fare il fine-tuning?

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux

#La domanda da risolvere prima di installare qualsiasi cosa

Sì, si può fare il fine-tuning di un modello con 7 o 8 miliardi di parametri su una scheda destinata al grande pubblico: la documentazione di Unsloth indica un minimo di 5 a 6 GB di VRAM in QLoRA 4 bit, quindi una scheda da 12 GB va bene, con margine per il contesto e il batch. Unsloth riscrive le fasi pesanti del fine-tuning LoRA e QLoRA, secondo l'editore, fino a due volte più veloce con il 70% in meno di VRAM, un dato valido solo per alcuni quaderni di codice (notebook). Il risultato viene esportato in GGUF per funzionare su Ollama. Ma la vera domanda prima dell'installazione è: il fine-tuning modifica il comportamento di un modello (tono, formato, registro), non ciò che sa di aggiornato. Se vuoi che conosca i tuoi documenti, costruisci prima una ricerca documentaria. Ricorda anche che la preparazione del set di dati richiede più tempo dell'addestramento.

Il fine-tuning modifica il comportamento di un modello. La ricerca documentale cambia ciò che sa al momento di rispondere. Confonderli fa perdere settimane.

Cosa vuoi e lo strumento corrispondente
Il tuo bisognoLa risposta corretta
Risposte basate sui tuoi documentiUna catena RAG: i documenti possono cambiare ogni giorno
Un formato di output costanteFine-tuning, o generazione vincolata
Un tono proprio, un registro di settoreFine-tuning
Il lessico di un settore specializzatoFine-tuning con un numero sufficiente di esempi
Informazioni che cambiano spessoRAG, sempre: riaddestrare il modello per una tariffa non ha alcun senso
Risposte più corte o più lunghePrima il prompt di sistema; non addestrare mai per questo
i
Se la risposta sincera è « voglio che conosca la nostra documentazione »
Fermati qui e costruisci prima un sistema di ricerca documentale. Si aggiorna aggiungendo un file e cita le proprie fonti, cosa che il fine-tuning non fa. La guida di Unsloth sostiene peraltro un'altra interpretazione: secondo questa guida, il fine-tuning può incorporare conoscenze e riprodurre tutto ciò che fa il RAG, mentre il contrario non è vero. In linea di principio è vero; il vantaggio pratico del RAG sta altrove: nell'aggiornamento, nella tracciabilità e nel costo di un nuovo addestramento a ogni cambiamento.

#Cosa cambia concretamente Unsloth

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Il metodo non è nuovo: si congelano i pesi del modello e si addestrano solo piccole matrici aggiunte a ciascun peso, pari a circa l'1 % dei parametri secondo la guida di Unsloth. LoRA mantiene il modello originale in 16 bit, QLoRA lo quantizza in 4 bit, risparmiando così il 75 % di memoria. È l'approccio standard, non appartiene a Unsloth.

Il contributo della libreria è l'implementazione, con kernel di calcolo riscritti per le fasi più pesanti. Il progetto esiste in tre forme: Unsloth Desktop, un'applicazione nativa, Unsloth Studio, un'interfaccia web, e Unsloth Core, la versione controllata tramite codice di cui parla questo articolo. È pubblicato con una doppia licenza: Apache 2.0 per il nucleo, AGPL-3.0 per alcuni componenti opzionali come l'interfaccia Studio. Dichiara di addestrare modelli linguistici, di diffusione, di sintesi vocale e di embedding due volte più velocemente con il 70% di VRAM in meno, senza perdita di precisione. Sulle architetture a miscela di esperti (MoE), il miglioramento dichiarato aumenta ulteriormente: fino a 12 volte più velocità con un risparmio di VRAM superiore al 35% su alcuni modelli recenti. Come tutti i dati forniti dagli sviluppatori, questi descrivono il caso migliore: il README stesso mostra che il «due volte, 70%» vale solo per alcuni notebook.

Miglioramenti annunciati da Unsloth a seconda del notebook (dati del produttore)
NotebookVelocità annunciataVRAM annunciata
Llama 3.1 (8B) Alpaca2 volte più veloce70 % in meno
gpt-oss (20B)2 volte più veloce70 % in meno
Qwen3.5 (4B), visione1,5 volte più veloce60 % in meno
Gemma 4 (E2B), visione1,5 volte più veloce50 % in meno
Orpheus-TTS (3B)1,5 volte più veloce50 % in meno
embeddinggemma (300M)2 volte più veloce20 % in meno

#Quale scheda per quale modello

Minimi pubblicati da Unsloth per un fine-tuning (GB di VRAM)
Dimensione del modelloQLoRA (4 bit)LoRA (16 bit)Interpretazione per una scheda grafica consumer
3 miliardi3,58Utilizzabile senza difficoltà su qualsiasi scheda recente in QLoRA
7 miliardi519QLoRA su 8 GB; LoRA a 16 bit richiede una scheda da 24 GB
8 miliardi622QLoRA con 8 GB o più; 12 GB lasciano margine
14 miliardi8,533QLoRA su 12 GB; LoRA a 16 bit fuori dalla portata di una scheda da 24 GB
27 miliardi2264QLoRA su 24 GB, senza margine; LoRA a 16 bit impossibile su una sola scheda
32 miliardi2676Al di sopra di 24 GB, anche in QLoRA
70 miliardi41164Fuori portata di una scheda grafica consumer

La documentazione specifica che questi numeri sono minimi assoluti: a seconda del modello, potrebbe essere necessario un valore maggiore. Identifica la dimensione del batch eccessiva come causa frequente di saturazione della memoria, da ridurre a 1, 2 o 3, e consiglia una lunghezza del contesto di 2048 per i primi test.

Hardware supportato secondo la documentazione di Unsloth
PiattaformaCosa dice la documentazione
NVIDIA, con Unsloth CoreLinux e Windows; compute capability minima 7.0 (V100, T4, RTX 20 e successive, A100, H100), Blackwell e DGX Spark inclusi. Le GTX 1070 e 1080 funzionano, lentamente.
AMD e IntelGuide dedicate; l'addestramento funziona su queste GPU, sia con Core sia con Studio.
MacUnsloth Studio supporta l'addestramento, MLX e l'inferenza GGUF (macOS 12 o successivo). Per Core, il supporto Apple Silicon (MLX) è indicato come «in preparazione».
Senza GPUStudio funziona per la chat con modelli GGUF e per la preparazione dei dati, non per l'addestramento.
Più GPUSupportato da Accelerate e DeepSpeed (FSDP, DDP), con configurazione manuale; l'opzione device_map="balanced" distribuisce un modello eccessivamente grande su più schede.
i
Verifica la pagina aggiornata
Questo panorama cambia velocemente: il README annuncia ora l'addestramento su GPU AMD su Windows, WSL e Linux, e un'applicazione desktop. Controlla la documentazione aggiornata prima di acquistare hardware.
!
Studio esposto sulla rete: strumenti server attivati
Il README di Unsloth avverte che gli strumenti lato server di Studio sono abilitati per impostazione predefinita. Esporre l'interfaccia (--secure, host non locale, accesso LAN) richiede una password di amministratore, e --disable-tools disattiva questi strumenti. Mantieni l'interfaccia su 127.0.0.1 finché non hai bisogno di renderla accessibile.

#Il vero lavoro sta nel dataset

Un fine-tuning non fallisce mai per colpa della libreria. Fallisce per colpa dei dati.

Formato
Un dataset, il più delle volte con due colonne, domanda e risposta, nella struttura di conversazione prevista dal modello. La guida consiglia di partire da un modello Instruct: accetta direttamente i template di conversazione (ChatML, ShareGPT) e richiede meno dati di un modello base. La regolarità conta più del volume.
Quantità
La guida di Unsloth raccomanda come minimo assoluto 100 righe e più di 1.000 righe per risultati migliori. Il tono e il formato si modificano con pochi esempi; un vero comportamento specifico del settore ne richiede di più, coerenti tra loro.
Qualità
Il modello imita ciò che gli viene mostrato, inclusi gli errori. Un difetto sistematico nei dati diventa un difetto sistematico del modello.
Set di controllo
Esempi che il modello non vede mai durante l'addestramento. Senza di essi, è impossibile distinguere l'apprendimento dalla semplice memorizzazione.
Senza codice
Unsloth Studio offre le Data Recipes, che trasformano PDF, CSV o DOCX in set di dati tramite un flusso visivo, con un'anteprima prima di avviare la creazione completa.
!
L'overfitting sembra un successo
La guida di Unsloth lo dice in una frase: se la perdita scende a 0, potrebbe trattarsi di sovraapprendimento e bisogna controllare la validazione. Una perdita compresa tra 0,5 e 1,0 è, secondo la guida, un buon segno in molti casi, ma dipende dal dataset e dal compito. Il modello che ha memorizzato i dati risponde perfettamente alle tue domande di test e peggio di prima a tutto il resto. Riserva il 20 % dei dati per il test, punta a 1–3 epoche per limitare il sovraapprendimento e monitora il set di controllo anziché la curva di addestramento.

#Dall'adattatore al modello utilizzabile

Il percorso si articola in tre fasi: caricare un modello a 4 bit, addestrarlo con uno dei notebook ufficiali, poi esportarlo. Il primo blocco di codice carica il modello e aggiunge gli adattatori LoRA; l'addestramento vero e proprio viene eseguito con uno dei notebook di Unsloth, che la guida consiglia di copiare nel tuo ambiente locale.

Caricare un modello in 4 bit con Unsloth Core
from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="unsloth/Qwen3-8B-unsloth-bnb-4bit",  # quantification dynamique 4 bits d'Unsloth
    max_seq_length=2048,
    load_in_4bit=True,
)
model = FastLanguageModel.get_peft_model(model, r=16, lora_alpha=16)

Il suffisso del nome conta. Secondo la guida, un modello il cui nome termina con unsloth-bnb-4bit usa una quantizzazione dinamica a 4 bit di Unsloth: consuma un po' più di VRAM rispetto a una quantizzazione BitsAndBytes standard, ma offre una precisione nettamente superiore. Un nome che termina solo con bnb-4bit indica la versione standard. La guida aggiunge che è vantaggioso usare la stessa precisione per l'addestramento e per l'erogazione del modello: erogarlo a 4 bit significa addestrarlo a 4 bit.

Impostazioni predefinite del manuale ufficiale
ParametroValore della guidaDa sapere
per_device_train_batch_size2Più grande: migliore utilizzo della GPU, ma addestramento rallentato dal padding; preferire gradient_accumulation_steps
gradient_accumulation_steps4Simula un batch più grande senza memoria aggiuntiva
max_steps60Valore per una prova rapida; per un vero addestramento, sostituire con num_train_epochs tra 1 e 3
learning_rate2e-4Più basso per un adattamento più lento e preciso: provare 1e-4, 5e-5 o 2e-5
max_seq_length2048Lunghezza consigliata per i test. Impostarla a un valore più alto «per avere margine» riserva memoria per sequenze assenti dai tuoi dati: misura prima la lunghezza effettiva dei tuoi esempi
  1. 01
    Addestrare
    Il risultato è un adattatore LoRA, di circa 100 MB nell'esempio di Unsloth, non un modello completo.
  2. 02
    Valutare
    Confrontando i risultati con il set di controllo e con il modello originale. «Migliore» va dimostrato, non dato per scontato. La guida segnala che gli strumenti di valutazione automatica possono non rispecchiare adeguatamente i tuoi criteri.
  3. 03
    Fondere o mantenere separato
    L'adattatore può restare separato e scambiabile, oppure essere fuso nei pesi: model.save_pretrained_merged con save_method="merged_16bit".
  4. 04
    Esportare in GGUF e quantizzare
    model.save_pretrained_gguf genera il file, con q4_k_m, q8_0 o f16 a scelta. Questo rende il risultato eseguibile da Ollama o llama.cpp su hardware ordinario.
Esportare un modello addestrato in GGUF (nella stessa sessione)
model.save_pretrained_gguf(
    "mon-modele-q4", tokenizer, quantization_method="q4_k_m"
)
# puis, avec le Modelfile fourni : ollama create mon-modele -f Modelfile
!
Il modello esportato dà risposte senza senso in Ollama
Caso frequente, descritto nella documentazione di Unsloth: il modello funziona bene in Unsloth, ma una volta esportato produce testo incomprensibile, generazioni senza fine o ripetizioni. La causa più comune è un template di conversazione diverso da quello usato durante l’addestramento. È necessario usare lo stesso template durante l’addestramento e l’inferenza, il token di fine sequenza corretto e verificare che il motore non aggiunga un token di inizio di troppo. La documentazione precisa che Unsloth crea automaticamente il Modelfile di Ollama con il template utilizzato durante il fine-tuning.

#Le trappole classiche

Partire da un modello base senza saperlo
La guida raccomanda i modelli Instruct: accettano i template di conversazione e richiedono meno dati. Un modello base richiede un formato diverso (Alpaca, Vicuna) e più esempi.
Dimenticare il template di conversazione
Esempi formattati in modo diverso da quello atteso dal modello producono un addestramento tecnicamente riuscito e praticamente inutile.
Misurare sugli esempi di addestramento
È l'errore che fa annunciare risultati spettacolari e consegnare modelli deludenti.
Credere che sostituirà la ricerca documentale
Ciò che insegni al modello diventa obsoleto il giorno in cui le tue informazioni cambiano, e il modello non cita le proprie fonti. Per i fatti che cambiano nel tempo, la ricerca documentale rimane più sicura.
Sottovalutare la pulizia degli esempi
Duplicati quasi identici nel set di dati distorcono l'addestramento a favore di questi casi specifici, senza che nulla lo segnali nelle metriche monitorate.
Modificare diversi parametri contemporaneamente
Modificare il tasso di apprendimento, il rango dell'adattatore e la lunghezza della sequenza nello stesso esperimento impedisce di capire quale abbia prodotto il cambiamento osservato.

#Casi d'uso concreti

Assistenza clienti con un tono costante
Un modello sottoposto a fine-tuning su scambi reali risponde con la voce del marchio, senza istruzioni di stile ripetute in ogni prompt.
Estrazione in un formato rigorosamente definito
Eseguire il fine-tuning su esempi di input-output stabilisce il formato di output in modo più affidabile rispetto a un semplice prompt, ed è utile prima di inviare il risultato a un sistema a valle.

Un punto in comune tra questi casi: ciascuno è misurabile. Prima di avviare un addestramento, formula il criterio di successo in una frase verificabile — «il formato JSON è rispettato in almeno il 95% degli output del set di controllo», ad esempio — anziché affidarti a un'impressione generale di miglioramento. È questo criterio, non l'intuizione, a indicare se il risultato giustifica il tempo investito.

#Il costo reale, oltre il prezzo della scheda

La scheda grafica è solo una delle voci da considerare. Raccogliere e pulire esempi coerenti, creare un set di controllo che il modello non vedrà mai e poi confrontare ogni versione con il modello originale pesa spesso più dell'addestramento stesso, che la guida di Unsloth illustra con una prova di 60 passi.

È per questo che Unsloth, per quanto sia rapido nell'addestramento, non riduce la durata di un progetto quanto si spera: elimina il collo di bottiglia tecnico, non il lavoro sui dati.

→
Cronometrare il primo test
La guida di Unsloth propone max_steps = 60 per fare in fretta. Su un insieme di dati ridotto, di poche centinaia di esempi, una prima prova completa, compresi addestramento e valutazione, fornisce una stima del tempo totale prima di impegnarsi sull'insieme completo.

#FAQ

È gratis Unsloth?+
La libreria centrale è sotto licenza Apache 2.0 e copre il fine-tuning LoRA e QLoRA senza costi; il repository ha più di 76.000 stelle su GitHub. Alcuni componenti opzionali, come l'interfaccia Studio, sono sotto licenza AGPL-3.0: la documentazione descrive questa doppia licenza come un modo per finanziare il progetto mantenendolo aperto. I notebook funzionano gratuitamente su Colab e Kaggle.
Quale scheda per effettuare il fine-tuning di un modello da 7 miliardi di parametri?+
La tabella di Unsloth indica un minimo di 5 GB per un modello da 7 miliardi di parametri in QLoRA a 4 bit e di 19 GB in LoRA a 16 bit. Una scheda da 12 GB è quindi adatta per QLoRA. La documentazione specifica che si tratta di minimi assoluti e che la dimensione del batch o esempi lunghi possono richiedere più memoria.
Quanti esempi servono?+
La guida di Unsloth consiglia un minimo assoluto di 100 righe e più di 1.000 righe per risultati migliori; se il dataset è troppo piccolo, si possono aggiungere dati sintetici o un dataset di Hugging Face. La regolarità conta più della quantità: i cattivi esempi insegnano cattive abitudini con la stessa certezza con cui i buoni esempi ne insegnano di buone.
Il modello ottenuto funziona in Ollama?+
Sì: si esporta in GGUF con model.save_pretrained_gguf, si sceglie la quantizzazione (q4_k_m è raccomandata dalla documentazione), poi si crea il modello in Ollama con un Modelfile. Unsloth genera questo Modelfile con lo schema di conversazione dell'addestramento. Se le risposte diventano incoerenti, verifica prima che lo schema e il token di fine sequenza siano gli stessi.
Funziona su AMD, su Mac o senza GPU?+
Sì per AMD e Intel, con guide dedicate. Su Mac, Unsloth Studio supporta l'addestramento e l'inferenza GGUF; Core non è ancora disponibile per Apple Silicon. Senza GPU, Studio serve per la chat e la preparazione dei dati, non per l'addestramento. Core richiede una scheda NVIDIA con capacità di calcolo 7.0 o superiore.
Il fine-tuning renderà il modello esperto dei miei dati?+
Non in modo duraturo. La guida di Unsloth sostiene che il fine-tuning può introdurre conoscenze, ma queste diventano obsolete non appena i tuoi dati cambiano, mentre un documento si può sostituire in un minuto e citare. Fatti e documenti rientrano nella ricerca documentale; tono, formato e registro rientrano nel fine-tuning. Combinare i due approcci è comune.

Hardware consigliato: RTX 5070 Ti 16 GB — scheda NVIDIA da 16 GB, sufficiente per affinare un modello 7-8B con QLoRA. Tutto l'hardware per l'IA →

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.