Principiante 9 minEdge

SmolLM3: quanto vale questo piccolo modello di Hugging Face ?

Risposta diretta

SmolLM3 è un modello Hugging Face da 3 miliardi di parametri, multilingue (tra cui il francese), con una finestra di contesto di 64.000 token usata durante l'addestramento, estendibile a 128.000, e una modalità di ragionamento attivabile tramite /think nel prompt di sistema. Punto importante prima di installarlo: non esiste una scheda ufficiale library/smollm3 su Ollama, ma solo tag della comunità o il GGUF ufficiale ospitato su Hugging Face, da recuperare tramite il suo indirizzo completo.

SmolLM3 è il piccolo modello linguistico pubblicato da Hugging Face, progettato per funzionare su hardware modesto mantenendo un contesto lungo e una modalità di ragionamento opzionale. Questa guida verifica cosa offre realmente il modello, mostra come installarlo senza scegliere la fonte sbagliata e chiarisce cosa ci si può ragionevolmente aspettare da un modello con 3B di parametri.

Di Mohamed Meguedmi·Agg. 2026-09-28·Testato su Windows, macOS e Linux

#SmolLM3 in una frase

SmolLM3 è un modello linguistico da 3 miliardi di parametri pubblicato da Hugging Face, posizionato tra i modelli da 1B troppo limitati per un uso generale e quelli da 7-8B che richiedono più memoria. L'interesse di un modello di queste dimensioni non è competere con un modello da 30B o più, ma rientrare nella memoria di una macchina modesta (portatile senza GPU dedicata, mini-PC), restando comunque utilizzabile per riassunti, testi brevi o semplici domande fattuali.

#Cosa propone davvero il modello

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Hugging Face indica che SmolLM3 è stato addestrato su 11,2 T token secondo una strategia a tre fasi. Il contesto di addestramento viene esteso progressivamente, dapprima da 4.000 a 32.000 token, poi da 32.000 a 64.000 token; oltre questa soglia, il modello può raggiungere 128.000 token grazie a una tecnica di estrapolazione chiamata YARN. È il doppio della lunghezza del contesto effettivamente usata nell’addestramento: va considerata una capacità massima, piuttosto che una garanzia di qualità costante su tutto questo contesto.

SmolLM3: ciò che è confermato dalla scheda ufficiale
CaratteristicaValore
Parametri3 miliardi
Contesto di addestramento64.000 token
Contesto esteso (YARN)128 000 token
Token di training11,2 T
Lingue supportate nativamente6 (tra cui il francese)

#Perché un modello da 3B gestisce un contesto lungo senza un consumo eccessivo di memoria

Hugging Face descrive in dettaglio le scelte architetturali che rendono questo contesto lungo gestibile su hardware modesto. SmolLM3 sostituisce la classica attenzione multi-head con la grouped-query attention a soli 4 gruppi, riducendo direttamente le dimensioni della cache KV da memorizzare per ogni token generato — il principale fattore che fa aumentare enormemente il consumo di RAM o VRAM quando il contesto si allunga. Il modello applica anche una tecnica chiamata NoPE (No Positional Encoding): il RoPE, la consueta codifica posizionale, viene rimosso da uno strato ogni quattro, un compromesso documentato per migliorare le prestazioni con contesti lunghi senza peggiorare quelle con contesti brevi.

Un altro dettaglio dell'addestramento ha un effetto concreto sulla qualità: l'attenzione utilizza un mascheramento intra-documento, cioè i token di due documenti diversi concatenati nella stessa sequenza di addestramento non si influenzano a vicenda. Per l'utente finale, questo limita il rischio che un modello compatto «mescoli» informazioni non correlate quando più fonti vengono inserite nello stesso contesto, un difetto più evidente nei piccoli modelli che in quelli grandi.

→
Impostazioni di sampling raccomandate
Hugging Face raccomanda temperature=0.6 e top_p=0.95 per le risposte in modalità standard. Questi valori non sono universali: determinano l'equilibrio tra creatività e coerenza e servono da punto di partenza prima di adattarli al tuo caso d'uso (abbassare la temperatura per risposte più fattuali, ad esempio).

#Il francese, lingua nativamente supportata

A differenza di molti piccoli modelli progettati inizialmente per l'inglese e poi adattati, SmolLM3 dichiara il francese tra le sue sei lingue supportate nativamente, accanto all'inglese, allo spagnolo, al tedesco, all'italiano e al portoghese. Hugging Face precisa anche che il modello ha visto dati in arabo, cinese e russo, ma in quantità inferiore rispetto alle sei lingue principali: da usare con cautela in queste lingue secondarie, poiché la scheda ufficiale non rivendica una qualità equivalente.

i
Gradiente di sorpresa
Un piccolo modello multilingue non è automaticamente valido in francese: conta la distribuzione effettiva dei dati di addestramento per lingua, non il numero di lingue elencate. Qui il francese fa parte della base principale dell'addestramento, non è un'aggiunta marginale.

#Installare: attenzione al tag

Prima trappola da evitare: al momento della redazione, non esiste una scheda ufficiale «library/smollm3» nel catalogo pubblico di Ollama. I tag reperibili con questo nome su ollama.com sono ripubblicazioni della comunità, in namespace personali, senza garanzia di conformità al repository originale. La strada affidabile consiste nell'usare il GGUF ufficiale pubblicato dall'organizzazione ggml-org su Hugging Face, che Ollama e llama.cpp possono caricare direttamente tramite il suo indirizzo completo.

  1. 01
    Verificare la fonte
    Utilizzare il repository ufficiale ggml-org/SmolLM3-3B-GGUF su Hugging Face anziché un tag della comunità non verificato, per essere certi della conformità del modello e del tokenizer.
  2. 02
    Avviare con Ollama
    Eseguire ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, che scarica e avvia direttamente la quantizzazione Q4_K_M da Hugging Face.
  3. 03
    Oppure avviare con llama.cpp
    Utilizzare llama-server -hf ggml-org/SmolLM3-3B-GGUF:Q4_K_M per un server locale, oppure llama-cli per una sessione da riga di comando.
  4. 04
    Scegliere la quantizzazione
    Q4_K_M (1,92 GB) per la maggior parte delle macchine, Q8_0 (3,28 GB) se hai memoria sufficiente e vuoi limitare la perdita di qualità, F16 (6,16 GB) solo come riferimento per il confronto.
Avviare SmolLM3 tramite Ollama (repository ufficiale Hugging Face)
ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M

Un tag comunitario, alibayram/smollm3, è presente anche direttamente nel catalogo pubblico di Ollama (ollama pull alibayram/smollm3) e funziona senza passare per l'indirizzo completo di Hugging Face. È tuttavia mantenuto da un singolo contributore, non da Hugging Face né dal team di Ollama: in caso di dubbi su una versione o di un comportamento inatteso, il GGUF ufficiale ggml-org resta il riferimento con cui fare un confronto prima di concludere che si tratti di un bug del modello stesso.

#Attiva la modalità di ragionamento

SmolLM3 funziona in due modalità: una modalità diretta e una modalità di ragionamento, che genera una sequenza di ragionamenti prima di rispondere. La modalità si attiva aggiungendo l'indicatore /think (o si disattiva con /no_think) nel prompt di sistema inviato al modello. Questa impostazione si configura a livello del messaggio di sistema, non tramite un'opzione di avvio: qualsiasi interfaccia che permetta di personalizzare il prompt di sistema può quindi attivare questa modalità.

→
Con llama.cpp
Per utilizzare la modalità di ragionamento esteso con llama.cpp, la documentazione ufficiale consiglia di aggiungere all'avvio l'opzione --jinja, che attiva la corretta elaborazione del template di chat necessario per questa modalità.

La modalità di ragionamento ha un costo diretto: ogni risposta inizia con una fase di riflessione interna più o meno lunga prima del testo finale, il che aumenta il numero di token generati e quindi il tempo di risposta. Per una semplice domanda fattuale, la modalità diretta (/no_think) resta più che sufficiente e nettamente più veloce.

#Come si colloca SmolLM3 rispetto ai modelli di altre dimensioni

Un modello con 3B di parametri si trova in una fascia intermedia del mercato dei piccoli modelli: più capace di un 1B, spesso limitato a compiti semplici e a uno stile piuttosto rigido, ma meno versatile di un 7-8B che rimane il punto di riferimento per un uso generale su una macchina con 8 GB di RAM o più. La domanda da porsi non è «SmolLM3 è valido?» in assoluto, ma «la mia macchina e il mio utilizzo giustificano il passaggio a 3B anziché restare su un 7-8B?».

Il contesto dichiarato (64.000 token in addestramento, fino a 128.000 tramite estrapolazione) è un elemento distintivo rispetto ai piccoli modelli concorrenti, spesso limitati a 8.000 o 32.000 token. In pratica, permette di inserire un documento più lungo in una sola volta, ad esempio per un riassunto, senza suddividerlo preventivamente. Questo vantaggio in termini di contesto non compensa però una carenza nelle capacità di ragionamento puro: su una domanda che richiede di concatenare più passaggi logici, un modello più grande rimane generalmente più affidabile, con o senza un contesto lungo.

i
Guadagno di informazione
L'evoluzione del contesto in fasi (4k, poi 32k, poi 64k) documentata da Hugging Face mostra che l'addestramento su contesto lungo avviene in fasi successive su volumi di token dedicati (100 miliardi di token solo per l'estensione del contesto), piuttosto che in una sola passata. È un'informazione utile per capire perché la qualità può variare in base alla lunghezza effettiva del testo elaborato, anche al di sotto del limite annunciato.

In termini di risultati, Hugging Face annuncia che SmolLM3 supera Llama-3.2-3B e Qwen2.5-3B su un insieme di 12 benchmark pubblici che coprono conoscenza, ragionamento, matematica e codice, mantenendosi competitivo rispetto a modelli 4B più pesanti. È un dato pubblicato dal produttore del modello, non una misura indipendente: colloca SmolLM3 tra i migliori modelli della sua fascia dimensionale, senza sostituire un test sui tuoi prompt se il tuo utilizzo va oltre l'ambito di questi benchmark generali.

Distribuzione dei dati di training in base all'avanzamento (fonte Hugging Face)
PassoToken accumulatiWebCodiceMatematica
Stadio 10 à 8 T85 %12 %3 %
Stadio 28 à 10 T75 %15 %10 %
Stadio 310 à 11,1 T63 %24 %13 %

Questo aumento del peso del codice e della matematica nella fase finale dell'addestramento (rispettivamente dal 12 % al 24 % e dal 3 % al 13 %) spiega in parte perché un modello di queste dimensioni riesce a svolgere compiti semplici di programmazione e di calcolo, mentre un piccolo modello addestrato esclusivamente su testi web generalisti fallisce più spesso.

#A cosa serve veramente 3B

Riassunto di un testo breve
Efficiente su documenti di poche pagine, con un contesto confortevole fino a 64.000 token in uso addestrato.
Scrittura di bozze brevi
Email, messaggi, riformulazioni: un uso tipico di un modello compatto, senza ambizioni creative avanzate.
Domande fattuali semplici
Risposte corrette su fatti comuni, con un rischio di errore più elevato rispetto a un modello più grande su domande specialistiche.
Integrazione embedded
La dimensione ridotta del modello e le quantizzazioni leggere (1,92 GB in Q4_K_M) lo rendono un candidato per macchine con memoria limitata, piuttosto che per compiti che richiedono un ragionamento complesso.

#Cosa non fa un 3B

Nessuna fonte ufficiale pubblica misurazioni delle prestazioni di SmolLM3 su hardware di largo consumo come un Raspberry Pi: qualsiasi promessa di questo tipo va verificata personalmente prima di assumerla come premessa per un deployment. Allo stesso modo, il contesto esteso a 128.000 token tramite YARN è una capacità tecnica, non una prova che la qualità delle risposte rimanga costante su un documento così lungo: resta necessario un test sul tuo specifico caso d'uso prima di farvi affidamento per un uso critico.

!
Obiezione: « Perché non un 7B subito? »
Se il tuo computer ha almeno 8 GB di RAM, un modello 7-8B in Q4 darà generalmente risultati migliori nell’uso generale. SmolLM3 ha senso quando la memoria o lo spazio di archiviazione sono davvero limitati, oppure quando la disponibilità di un contesto lungo in un modello 3B è un criterio decisivo per il tuo utilizzo.
Domande frequenti
SmolLM3 è disponibile direttamente su Ollama?+
Non tramite una scheda ufficiale library/smollm3 al momento della redazione. Il comando affidabile rimane ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, che scarica il GGUF ufficiale da Hugging Face con la quantizzazione che preferisci. Esiste anche un tag della community, alibayram/smollm3, che funziona, ma è mantenuto solo da un singolo collaboratore, non da Hugging Face né dal team di Ollama.
SmolLM3 parla bene il francese?+
Il francese fa parte delle 6 lingue supportate nativamente secondo la scheda Hugging Face, insieme all'inglese, allo spagnolo, al tedesco, all'italiano e al portoghese, con una base di dati di addestramento dedicata anziché un'aggiunta marginale. È uno dei punti forti del modello rispetto a piccoli modelli incentrati principalmente sull'inglese.
Come attivare la modalità di ragionamento di SmolLM3?+
Aggiungendo l'indicatore /think nel prompt di sistema inviato al modello (o /no_think per disattivarlo e rimanere in modalità diretta, più veloce). Con llama.cpp, aggiungi l'opzione --jinja all'avvio affinché il template di chat necessario a questa modalità venga applicato correttamente; altrimenti la fase di riflessione potrebbe non concludersi mai correttamente.
Qual è la quantizzazione da scegliere per SmolLM3?+
Q4_K_M (1,92 GB) va bene per la maggior parte dei dispositivi e rimane la scelta predefinita consigliata per un buon rapporto qualità/memoria. Q8_0 (3,28 GB) riduce la perdita di qualità se hai memoria disponibile. F16 (6,16 GB) serve soprattutto da riferimento di confronto durante i tuoi test, raramente utile nell'uso quotidiano su un 3B.
Quali impostazioni di sampling usare con SmolLM3?+
Hugging Face suggerisce temperature=0.6 e top_p=0.95 come punto di partenza in modalità standard, valori che bilanciano coerenza e varietà delle risposte. Non sono impostazioni universali: ridurli aiuta a ottenere risposte più fattuali e riproducibili per un uso tecnico, aumentarli leggermente favorisce riformulazioni più varie per la scrittura creativa.
SmolLM3 è meglio di Qwen2.5-3B o Llama-3.2-3B?+
Hugging Face annuncia che SmolLM3 supera questi due modelli su 12 benchmark pubblici di conoscenza, ragionamento, matematica e codice, rimanendo competitivo rispetto a modelli da 4B. È un risultato pubblicato dallo sviluppatore, da confermare sui tuoi prompt se il tuo utilizzo reale differisce da questi benchmark generici.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.