Hugging Face: cos'è e come usarlo ?
Hugging Face è la piattaforma dove vengono pubblicati quasi tutti i modelli di IA aperti: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. La si descrive spesso come il GitHub del machine learning: il repository da cui vengono i file, inclusi quelli che Ollama e LM Studio scaricano per te. L'Hub ha superato i tre milioni di modelli pubblici il 18 agosto 2026, senza alcun filtro editoriale.
Hugging Face è la piattaforma dove vengono pubblicati quasi tutti i modelli aperti di intelligenza artificiale: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. La si descrive spesso come il GitHub del machine learning. Per chi fa girare un'IA sul proprio computer, è l'archivio da cui provengono tutti i file, inclusi quelli che Ollama e LM Studio scaricano per te. L'Hub ha ufficialmente superato la soglia dei tre milioni di modelli pubblici il 18 agosto 2026, a un ritmo di circa 2.700–3.000 nuovi modelli al giorno, senza alcuna selezione. Questa pagina ti insegna a orientarti: quale repository aprire, quale file scegliere per la tua scheda grafica e cosa verificare prima di cliccare.
#Hugging Face, cos'è?
Hugging Face è un'azienda fondata nel 2016 da tre imprenditori francesi, Clément Delangue, Julien Chaumond e Thomas Wolf, con sedi a New York e Parigi e sede legale tuttora negli Stati Uniti. Ha iniziato con un'applicazione di chatbot destinata agli adolescenti, un progetto oggi abbandonato: da qui il nome, preso dall'emoji che sorride con le mani aperte. Si è poi orientata verso gli strumenti open source per il machine learning: la sua libreria transformers è diventata il modo pressoché standard di caricare ed eseguire un modello linguistico in Python, adottata dalla maggior parte dei laboratori di ricerca e delle aziende del settore. L'azienda ha infine realizzato l'Hub, una piattaforma di hosting basata sul sistema di controllo delle versioni Git, dove chiunque può pubblicare gratuitamente modelli, set di dati e piccole demo web, senza previa approvazione editoriale.
Per l'IA locale, l'Hub svolge il ruolo di uno store di applicazioni, con due differenze: quasi tutto è gratuito e nulla viene selezionato per te. A differenza di uno store di applicazioni classico, nessuno testa, approva o classifica i modelli prima della pubblicazione: chiunque può creare un account gratuito e caricare un repository in pochi minuti, senza alcuna validazione né controllo qualità. Questa totale assenza di filtri è al tempo stesso la forza dell'Hub — tutto arriva lì per primo, spesso ancora prima dell'annuncio ufficiale di un laboratorio — e la sua principale insidia per un principiante, che può trovarsi davanti a centinaia di risultati di ricerca senza sapere quale sia affidabile. Sapersi orientare, distinguere un repository ufficiale da una copia di terzi e una conversione seria da un tentativo abbandonato è la competenza da acquisire prima di scaricare qualsiasi cosa.
#I tre reparti dell'Hub
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
| Sezione | Contenuto | Interesse per l'IA locale |
|---|---|---|
| Models | File dei pesi, configurazione, documentazione | È qui che si trova il file che farai girare |
| Datasets | Dati di addestramento e valutazione | Solo se stai facendo fine-tuning o test |
| Spaces | Piccole applicazioni web, soprattutto demo | Provare un modello nel browser prima di scaricare 15 GB |
#Leggere la pagina di un modello
Ogni modello ha un indirizzo del tipo huggingface.co/organisation/nom-du-modele, ad esempio huggingface.co/Qwen/Qwen3-8B. Quattro elementi distinti di questa pagina meritano la tua attenzione prima di qualsiasi download.
- Nome dell'organizzazione
- Qwen, google, meta-llama, mistralai, openai, deepseek-ai sono i laboratori stessi, verificati. Qualsiasi altro nome indica un terzo: a volte eccellente, ma mai l'originale del laboratorio.
- La scheda del modello (model card)
- Il file README: che cos'è il modello, come è stato addestrato, i suoi usi previsti, i suoi punteggi, il formato del prompt e i suoi limiti. La qualità varia: alcuni sono molto completi, altri sono vuoti.
- La licenza
- Visualizzata ben in evidenza nella parte superiore della scheda, accanto al nome del modello. Consultare la sezione dedicata più avanti per sapere cosa autorizza realmente ogni licenza comune.
- La scheda Files and versions
- L'elenco completo dei file scaricabili. Un'occhiata veloce basta per capire subito in quale tipo di repository ti trovi.
#Quale repository scegliere: pesi originali o GGUF
| Ciò che vedi in Files | Cos'è | Per quali strumenti | Dimensione per un modello 8B |
|---|---|---|---|
| model-00001-of-00004.safetensors… | Pesi originali in BF16, suddivisi in più file | transformers, vLLM, strumenti di fine-tuning | ≈ 16 GB |
| …-Q4_K_M.gguf, …-Q8_0.gguf | Conversioni quantizzate, un solo file per livello | Ollama, LM Studio, llama.cpp, KoboldCpp, Jan | ≈ 5 GB in Q4 |
| Repository …-AWQ, …-GPTQ, …-FP8 | Quantizzazione pensata per i server GPU | vLLM e motori equivalenti | ≈ da 5 a 9 GB |
| Repository …-MLX-4bit | Formato Apple Silicon | MLX, LM Studio su Mac | ≈ 5 GB |
I laboratori pubblicano soprattutto il primo tipo, i pesi originali così come escono dall'addestramento. I file GGUF necessari alle applicazioni desktop vengono prodotti separatamente da chi si occupa delle conversioni: alcuni laboratori pubblicano direttamente i propri, mentre contributori della comunità come bartowski, unsloth o l'organizzazione ggml-org coprono quasi tutto il resto, in genere solo poche ore dopo un'uscita molto attesa. Per trovarli senza cercare a caso, apri la pagina del modello originale e segui il collegamento Quantizations nell'albero del modello, visualizzato a destra della pagina, oppure cerca semplicemente il nome del modello seguito dalla parola GGUF nella barra di ricerca dell'Hub, che solitamente mostra le conversioni più scaricate in testa alla lista.
#Scegliere il file corretto per la tua scheda
Un repository GGUF offre spesso una buona decina di file per lo stesso modello, uno per ogni livello di quantizzazione disponibile, dal più compresso al più fedele. La dimensione del file corrisponde, approssimativamente, alla VRAM che i pesi occuperanno una volta caricato il modello in memoria. Mantieni sempre da 1 a 3 GB di VRAM liberi per il contesto della conversazione e il margine operativo del sistema.
| Modello | Q4_K_M | Q5_K_M | Q8_0 | BF16 | Scheda con un buon margine in Q4 |
|---|---|---|---|---|---|
| Qwen 3 8B | 5 GB | 6 GB | 9 GB | 16 GB | 8 GB |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | 24 GB | 12 GB |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | 28 GB | 12 GB |
| gpt-oss 20B | 13 GB | 16 GB | 23 GB | 42 GB | 16 GB |
| Mistral Small 3.2 24B | 14 GB | 17 GB | 26 GB | 48 GB | 16 GB |
| Qwen 3.8 27B | 16 GB | 19 GB | 29 GB | 54 GB | 24 GB |
| Llama 3.3 70B | 40 GB | 48 GB | 75 GB | 140 GB | 2 × 24 GB |
- Q4, Q5, Q8 o FP16: scegliere la quantizzazione
- VRAM: conoscere la tua e sapere cosa permette
- Calcolatore della VRAM
#Tre modi per scaricare
La soluzione più semplice consiste nel lasciare che se ne occupi il tuo strumento. La ricerca di LM Studio interroga direttamente Hugging Face e indica quali file rientrano nella capacità della tua macchina. Ollama e llama.cpp possono entrambi scaricare un repository GGUF a partire dal suo nome.
Il filtro --include è importante: senza di esso, scarichi tutte le quantizzazioni del repository, spesso più di 100 GB. Terza opzione, il browser: scheda Files and versions, freccia di download accanto al file. Pratico per un singolo GGUF, inadatto ai pesi originali suddivisi in più file.
#Licenze: aperto non vuol dire senza condizioni
| Licenza | Esempi dal catalogo | Uso commerciale |
|---|---|---|
| Apache 2.0 | Famiglia Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2 | Sì, con precisazione |
| MIT | Distillazioni DeepSeek R1, GLM 4.7 Flash | Sì |
| Llama Community License | Llama 3.3 70B | Sì, a determinate condizioni: regole di denominazione, politica d'uso, soglia di utenti |
| Non commerciale, ricerca | Varie pubblicazioni di ricerca | No |
In caso di dubbio fa fede l'etichetta visualizzata sulla scheda del modello, e un modello derivato, sottoposto a fine-tuning o ottenuto fondendo altri modelli eredita in genere gli obblighi del modello di base, anche quando il README del derivato non ne parla esplicitamente. Per un deployment in azienda o in un prodotto commerciale, questi due minuti di lettura attenta della licenza evitano di costruire un'intera integrazione su un modello il cui uso commerciale è in realtà limitato: un errore frequente e costoso da correggere a posteriori.
#È sicuro?
- Preferisci .safetensors e .gguf
- Sono formati che contengono solo dati. I vecchi file PyTorch .bin e .pt si basano sul meccanismo pickle di Python, capace di eseguire codice durante il caricamento. L'Hub li segnala con un avvertimento.
- Fai attenzione al « trust remote code »
- Alcuni repository, in particolare quelli per architetture recenti non ancora integrate nella libreria transformers, includono codice Python personalizzato che il caricatore chiede esplicitamente il permesso di eseguire prima di continuare. Concedi questa autorizzazione solo per organizzazioni che riconosci e di cui ti fidi: questo codice viene eseguito con gli stessi privilegi del resto del tuo programma Python, senza limitazioni particolari.
- Guarda chi pubblica
- Il numero cumulativo di download, l'elenco degli altri repository pubblicati dalla stessa organizzazione e un link al repository presente sul sito ufficiale del laboratorio sono buoni segnali di affidabilità. Sullo Hub, come altrove sul web, esistono account che imitano organizzazioni note usando un nome simile, con un refuso o un underscore in più: un'occhiata al numero di download e all'anzianità dell'account spesso basta a individuarli.
- Il modello resta sulla tua macchina
- Una volta scaricato, un GGUF eseguito da llama.cpp o Ollama non effettua più alcuna chiamata di rete né a Hugging Face né a nessun altro, a differenza di un modello utilizzato tramite un'API ospitata nel cloud. I tuoi prompt e i tuoi dati non lasciano mai il tuo computer: un argomento centrale in termini di riservatezza per chi sceglie l'IA locale invece di un servizio online.
- Documentazione ufficiale dell'Hub Hugging Face
- Il catalogo QuelLLM: 249 modelli ordinati per hardware
- Fonte: Wikipedia, storia dell'azienda
- Fonte: annuncio ufficiale della nuova CLI hf
#FAQ
A cosa serve Hugging Face?+
Hugging Face è gratuito?+
Hugging Face è una società francese?+
Serve un account per scaricare un modello?+
Qual è il file da scaricare per Ollama o LM Studio?+
Serve ancora usare huggingface-cli per scaricare un modello?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.