Principiante 11 minConcetti

Hugging Face: cos'è e come usarlo ?

Risposta diretta

Hugging Face è la piattaforma dove vengono pubblicati quasi tutti i modelli di IA aperti: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. La si descrive spesso come il GitHub del machine learning: il repository da cui vengono i file, inclusi quelli che Ollama e LM Studio scaricano per te. L'Hub ha superato i tre milioni di modelli pubblici il 18 agosto 2026, senza alcun filtro editoriale.

Hugging Face è la piattaforma dove vengono pubblicati quasi tutti i modelli aperti di intelligenza artificiale: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. La si descrive spesso come il GitHub del machine learning. Per chi fa girare un'IA sul proprio computer, è l'archivio da cui provengono tutti i file, inclusi quelli che Ollama e LM Studio scaricano per te. L'Hub ha ufficialmente superato la soglia dei tre milioni di modelli pubblici il 18 agosto 2026, a un ritmo di circa 2.700–3.000 nuovi modelli al giorno, senza alcuna selezione. Questa pagina ti insegna a orientarti: quale repository aprire, quale file scegliere per la tua scheda grafica e cosa verificare prima di cliccare.

Di Mohamed Meguedmi·Agg. 2026-09-28·Testato su Windows, macOS e Linux

#Hugging Face, cos'è?

Hugging Face è un'azienda fondata nel 2016 da tre imprenditori francesi, Clément Delangue, Julien Chaumond e Thomas Wolf, con sedi a New York e Parigi e sede legale tuttora negli Stati Uniti. Ha iniziato con un'applicazione di chatbot destinata agli adolescenti, un progetto oggi abbandonato: da qui il nome, preso dall'emoji che sorride con le mani aperte. Si è poi orientata verso gli strumenti open source per il machine learning: la sua libreria transformers è diventata il modo pressoché standard di caricare ed eseguire un modello linguistico in Python, adottata dalla maggior parte dei laboratori di ricerca e delle aziende del settore. L'azienda ha infine realizzato l'Hub, una piattaforma di hosting basata sul sistema di controllo delle versioni Git, dove chiunque può pubblicare gratuitamente modelli, set di dati e piccole demo web, senza previa approvazione editoriale.

Per l'IA locale, l'Hub svolge il ruolo di uno store di applicazioni, con due differenze: quasi tutto è gratuito e nulla viene selezionato per te. A differenza di uno store di applicazioni classico, nessuno testa, approva o classifica i modelli prima della pubblicazione: chiunque può creare un account gratuito e caricare un repository in pochi minuti, senza alcuna validazione né controllo qualità. Questa totale assenza di filtri è al tempo stesso la forza dell'Hub — tutto arriva lì per primo, spesso ancora prima dell'annuncio ufficiale di un laboratorio — e la sua principale insidia per un principiante, che può trovarsi davanti a centinaia di risultati di ricerca senza sapere quale sia affidabile. Sapersi orientare, distinguere un repository ufficiale da una copia di terzi e una conversione seria da un tentativo abbandonato è la competenza da acquisire prima di scaricare qualsiasi cosa.

#I tre reparti dell'Hub

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
SezioneContenutoInteresse per l'IA locale
ModelsFile dei pesi, configurazione, documentazioneÈ qui che si trova il file che farai girare
DatasetsDati di addestramento e valutazioneSolo se stai facendo fine-tuning o test
SpacesPiccole applicazioni web, soprattutto demoProvare un modello nel browser prima di scaricare 15 GB

#Leggere la pagina di un modello

Ogni modello ha un indirizzo del tipo huggingface.co/organisation/nom-du-modele, ad esempio huggingface.co/Qwen/Qwen3-8B. Quattro elementi distinti di questa pagina meritano la tua attenzione prima di qualsiasi download.

Nome dell'organizzazione
Qwen, google, meta-llama, mistralai, openai, deepseek-ai sono i laboratori stessi, verificati. Qualsiasi altro nome indica un terzo: a volte eccellente, ma mai l'originale del laboratorio.
La scheda del modello (model card)
Il file README: che cos'è il modello, come è stato addestrato, i suoi usi previsti, i suoi punteggi, il formato del prompt e i suoi limiti. La qualità varia: alcuni sono molto completi, altri sono vuoti.
La licenza
Visualizzata ben in evidenza nella parte superiore della scheda, accanto al nome del modello. Consultare la sezione dedicata più avanti per sapere cosa autorizza realmente ogni licenza comune.
La scheda Files and versions
L'elenco completo dei file scaricabili. Un'occhiata veloce basta per capire subito in quale tipo di repository ti trovi.

#Quale repository scegliere: pesi originali o GGUF

Ciò che vedi in FilesCos'èPer quali strumentiDimensione per un modello 8B
model-00001-of-00004.safetensors…Pesi originali in BF16, suddivisi in più filetransformers, vLLM, strumenti di fine-tuning≈ 16 GB
…-Q4_K_M.gguf, …-Q8_0.ggufConversioni quantizzate, un solo file per livelloOllama, LM Studio, llama.cpp, KoboldCpp, Jan≈ 5 GB in Q4
Repository …-AWQ, …-GPTQ, …-FP8Quantizzazione pensata per i server GPUvLLM e motori equivalenti≈ da 5 a 9 GB
Repository …-MLX-4bitFormato Apple SiliconMLX, LM Studio su Mac≈ 5 GB

I laboratori pubblicano soprattutto il primo tipo, i pesi originali così come escono dall'addestramento. I file GGUF necessari alle applicazioni desktop vengono prodotti separatamente da chi si occupa delle conversioni: alcuni laboratori pubblicano direttamente i propri, mentre contributori della comunità come bartowski, unsloth o l'organizzazione ggml-org coprono quasi tutto il resto, in genere solo poche ore dopo un'uscita molto attesa. Per trovarli senza cercare a caso, apri la pagina del modello originale e segui il collegamento Quantizations nell'albero del modello, visualizzato a destra della pagina, oppure cerca semplicemente il nome del modello seguito dalla parola GGUF nella barra di ricerca dell'Hub, che solitamente mostra le conversioni più scaricate in testa alla lista.

#Scegliere il file corretto per la tua scheda

Un repository GGUF offre spesso una buona decina di file per lo stesso modello, uno per ogni livello di quantizzazione disponibile, dal più compresso al più fedele. La dimensione del file corrisponde, approssimativamente, alla VRAM che i pesi occuperanno una volta caricato il modello in memoria. Mantieni sempre da 1 a 3 GB di VRAM liberi per il contesto della conversazione e il margine operativo del sistema.

Calcolato dal catalogo QuelLLM · 20/09/2026 · dimensioni arrotondate al GB superiore
ModelloQ4_K_MQ5_K_MQ8_0BF16Scheda con un buon margine in Q4
Qwen 3 8B5 GB6 GB9 GB16 GB8 GB
Gemma 4 12B7 GB9 GB13 GB24 GB12 GB
Qwen 3 14B9 GB11 GB16 GB28 GB12 GB
gpt-oss 20B13 GB16 GB23 GB42 GB16 GB
Mistral Small 3.2 24B14 GB17 GB26 GB48 GB16 GB
Qwen 3.8 27B16 GB19 GB29 GB54 GB24 GB
Llama 3.3 70B40 GB48 GB75 GB140 GB2 × 24 GB

#Tre modi per scaricare

La soluzione più semplice consiste nel lasciare che se ne occupi il tuo strumento. La ricerca di LM Studio interroga direttamente Hugging Face e indica quali file rientrano nella capacità della tua macchina. Ollama e llama.cpp possono entrambi scaricare un repository GGUF a partire dal suo nome.

Da Ollama o llama.cpp
# Ollama : lancer n'importe quel dépôt GGUF du Hub
ollama run hf.co/bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M

# llama.cpp : télécharger et servir
llama-server -hf bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M
Con lo strumento da riga di comando
pip install -U huggingface_hub
hf download bartowski/Qwen_Qwen3-8B-GGUF --include "*Q4_K_M.gguf" --local-dir ./models

Il filtro --include è importante: senza di esso, scarichi tutte le quantizzazioni del repository, spesso più di 100 GB. Terza opzione, il browser: scheda Files and versions, freccia di download accanto al file. Pratico per un singolo GGUF, inadatto ai pesi originali suddivisi in più file.

i
Un vecchio tutorial ti parla di huggingface-cli?
Ignoralo: il comando huggingface-cli download è deprecato ed è stato rimosso del tutto a partire dalla versione 1.0 della libreria huggingface_hub, sostituito dal comando più breve hf, presentato dalla stessa Hugging Face come «una CLI più veloce e più intuitiva». La sostituzione è meccanica: hf download ovunque il vecchio tutorial riportava huggingface-cli download, con le stesse opzioni.
i
Modelli con accesso condizionato
Alcuni laboratori, tra cui Meta per la famiglia Llama, richiedono di accettare le loro condizioni prima del download. Crea un account gratuito, clicca sul pulsante di accesso della pagina del modello, poi autentica lo strumento da riga di comando una sola volta con hf auth login e un token creato nelle impostazioni dell'account. Le conversioni GGUF della comunità generalmente non hanno restrizioni di accesso, ma la licenza originale si applica comunque anche a te.

#Licenze: aperto non vuol dire senza condizioni

Licenze rilevate nel catalogo QuelLLM · 20/09/2026
LicenzaEsempi dal catalogoUso commerciale
Apache 2.0Famiglia Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2Sì, con precisazione
MITDistillazioni DeepSeek R1, GLM 4.7 FlashSì
Llama Community LicenseLlama 3.3 70BSì, a determinate condizioni: regole di denominazione, politica d'uso, soglia di utenti
Non commerciale, ricercaVarie pubblicazioni di ricercaNo

In caso di dubbio fa fede l'etichetta visualizzata sulla scheda del modello, e un modello derivato, sottoposto a fine-tuning o ottenuto fondendo altri modelli eredita in genere gli obblighi del modello di base, anche quando il README del derivato non ne parla esplicitamente. Per un deployment in azienda o in un prodotto commerciale, questi due minuti di lettura attenta della licenza evitano di costruire un'intera integrazione su un modello il cui uso commerciale è in realtà limitato: un errore frequente e costoso da correggere a posteriori.

#È sicuro?

Preferisci .safetensors e .gguf
Sono formati che contengono solo dati. I vecchi file PyTorch .bin e .pt si basano sul meccanismo pickle di Python, capace di eseguire codice durante il caricamento. L'Hub li segnala con un avvertimento.
Fai attenzione al « trust remote code »
Alcuni repository, in particolare quelli per architetture recenti non ancora integrate nella libreria transformers, includono codice Python personalizzato che il caricatore chiede esplicitamente il permesso di eseguire prima di continuare. Concedi questa autorizzazione solo per organizzazioni che riconosci e di cui ti fidi: questo codice viene eseguito con gli stessi privilegi del resto del tuo programma Python, senza limitazioni particolari.
Guarda chi pubblica
Il numero cumulativo di download, l'elenco degli altri repository pubblicati dalla stessa organizzazione e un link al repository presente sul sito ufficiale del laboratorio sono buoni segnali di affidabilità. Sullo Hub, come altrove sul web, esistono account che imitano organizzazioni note usando un nome simile, con un refuso o un underscore in più: un'occhiata al numero di download e all'anzianità dell'account spesso basta a individuarli.
Il modello resta sulla tua macchina
Una volta scaricato, un GGUF eseguito da llama.cpp o Ollama non effettua più alcuna chiamata di rete né a Hugging Face né a nessun altro, a differenza di un modello utilizzato tramite un'API ospitata nel cloud. I tuoi prompt e i tuoi dati non lasciano mai il tuo computer: un argomento centrale in termini di riservatezza per chi sceglie l'IA locale invece di un servizio online.

#FAQ

A cosa serve Hugging Face?+
Per pubblicare e scaricare modelli di IA aperti, dataset e piccole demo web. Per l'IA locale, è la principale fonte dei file dei modelli, in particolare delle versioni GGUF quantizzate che Ollama, LM Studio e llama.cpp caricano direttamente, spesso prodotte da contributori della comunità poche ore dopo la pubblicazione ufficiale di un modello da parte del laboratorio che lo ha sviluppato.
Hugging Face è gratuito?+
Consultare e scaricare i modelli pubblici è completamente gratuito e non richiede un account, tranne per i modelli ad accesso condizionato, per i quali l'account resta gratuito. L'azienda fa pagare invece l'inferenza ospitata sui suoi server, la potenza di calcolo aggiuntiva per gli Spaces, l'archiviazione dei repository privati e le sue offerte rivolte alle aziende.
Hugging Face è una società francese?+
È stata fondata nel 2016 da tre imprenditori francesi, Clément Delangue, Julien Chaumond e Thomas Wolf, e mantiene un team numeroso a Parigi, ma la sua sede legale è a New York, negli Stati Uniti. È una delle poche piattaforme di primo piano dell'IA mondiale ad avere radici francesi così marcate.
Serve un account per scaricare un modello?+
Non nella grande maggioranza dei casi: la consultazione e il download dei modelli pubblici non richiedono nulla. Un account gratuito e un token di accesso diventano necessari solo per i modelli il cui laboratorio richiede l'accettazione preventiva delle proprie condizioni d'uso, come la famiglia Llama di Meta o alcuni modelli rilasciati da Google.
Qual è il file da scaricare per Ollama o LM Studio?+
Un solo file .gguf proveniente da un repository GGUF, in genere la variante Q4_K_M per iniziare, le cui dimensioni siano da 1 a 3 GB inferiori alla memoria della tua scheda grafica. I file .safetensors suddivisi in parti del repository originale del laboratorio sono destinati ai framework Python come transformers e ai motori server come vLLM, non alle applicazioni desktop.
Serve ancora usare huggingface-cli per scaricare un modello?+
No: questo comando è deprecato ed è stato rimosso nella versione 1.0 di huggingface_hub. Il comando attuale, presentato da Hugging Face come più veloce e più semplice, si chiama hf: hf download seguito dal nome del repository funziona esattamente dove un vecchio tutorial indicava huggingface-cli download, con le stesse opzioni di filtraggio.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.