Falcon H1 in locale: l'ibrido Mamba proveniente dagli Emirati
Falcon H1 è la famiglia di modelli open-weight del Technology Innovation Institute di Abu Dhabi, e la prima di TII a combinare attenzione classica e strati Mamba in ogni blocco. Questa guida spiega quali cambiamenti introduce questa architettura ibrida, quale dimensione di Falcon H1 installare in locale in base alla tua VRAM, come misurare il risparmio di memoria con contesti lunghi e se vale la pena sostituire Mistral Small o Qwen3 nel tuo stack Ollama.
#Perché interessarsi a Falcon H1
I primi Falcon, nel 2023, avevano lasciato il segno nel panorama dei modelli open-weight prima di essere superati da Llama, Mistral e poi Qwen. Falcon H1, pubblicato a maggio 2025 dal Technology Innovation Institute (TII) di Abu Dhabi, cambia approccio: invece di rincorrere i transformer classici, TII riparte da un'architettura diversa, combinando attenzione e modelli a spazio di stato (Mamba-2), per ottenere modelli compatti che reggono il confronto con concorrenti due volte più grandi.
Per l'uso locale, l'interesse sta in tre punti. La gamma copre tutte le configurazioni, da 0,5 miliardi di parametri per un Raspberry Pi o un vecchio portatile fino a 34 miliardi per una RTX 4090 o un Mac con memoria unificata. Il contesto dichiarato raggiunge 256.000 token, e l'architettura ibrida lo rende realmente utilizzabile in locale dove un transformer classico satura la VRAM. Infine, Falcon H1 è stato addestrato nativamente su 18 lingue, tra cui il francese e l'arabo, il che lo rende un candidato serio per testi in francese senza passare per un modello incentrato sull'inglese o sul cinese.
#L'ibrido attention-Mamba in due parole
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Un transformer classico si basa interamente sull'attenzione. A ogni nuovo token, il modello rilegge l'intero contesto e conserva per ogni token precedente una coppia di vettori, la famosa cache KV. Questa memoria cresce linearmente con la lunghezza della conversazione o del documento. È questa, e non i pesi del modello, a far superare la capacità di memoria della tua scheda grafica quando carichi un lungo rapporto.
Mamba appartiene a un'altra famiglia, i modelli a spazio di stato (state space models). Uno strato Mamba non rilegge il passato: mantiene uno stato ricorrente di dimensione fissa che riassume ciò che precede, come una rete ricorrente modernizzata. La memoria per token è costante, il throughput rimane stabile qualunque sia la lunghezza del contesto. Il compromesso noto è un recupero meno preciso dei dettagli lontani: un modello Mamba puro ritrova meno facilmente un numero preciso nascosto a pagina 40.
I modelli ibridi puntano al meglio di entrambi. Mentre IBM Granite 4 o Jamba alternano strati Mamba e strati di attenzione, Falcon H1 adotta uno schema parallelo: in ogni blocco, teste di attenzione e teste Mamba-2 lavorano fianco a fianco sullo stesso input, e le loro uscite vengono concatenate prima dello strato successivo. TII ha regolato il rapporto tra i due a favore dei canali Mamba, mantenendo così la memoria dedicata all'attenzione a un livello molto inferiore a quella di un modello Transformer di dimensioni equivalenti, pur conservando abbastanza attenzione per recuperare un dettaglio preciso.
- Transformer classico (Mistral, Qwen, Llama)
- 100% attenzione. Massima qualità nel richiamo delle informazioni, ma cache KV proporzionale al contesto: il consumo di VRAM cresce vertiginosamente oltre qualche decina di migliaia di token.
- Mamba puro (Falcon Mamba 7B)
- Memoria costante per token, molto veloce sui flussi lunghi. Minore capacità di richiamare i dettagli lontani e supporto software ancora disomogeneo.
- Ibrido sequenziale (Granite 4, Jamba)
- Strati Mamba prevalenti, intervallati da strati di attenzione. Buon risparmio di memoria, architettura semplice da implementare nei runtime.
- Ibrido parallelo (Falcon H1)
- Attention e Mamba-2 in ogni blocco, output concatenati. Il modello decide a ogni livello cosa affidare alla memoria precisa e cosa alla memoria compressa.
#Le dimensioni disponibili: da 0,5B a 34B
TII pubblica Falcon H1 in sei dimensioni, ciascuna disponibile in versione Base (pre-addestrata) e Instruct (chat). Per l'uso con Ollama o LM Studio, ti interessano solo le versioni Instruct. Tutte condividono la stessa architettura e lo stesso tokenizer multilingue.
- Falcon H1 0.5B
- Il più piccolo. Per sistemi embedded, un test di pipeline o un Raspberry Pi. Non aspettarti che sia all'altezza di un compito di scrittura impegnativo.
- Falcon H1 1.5B
- Classificazione, estrazione semplice, autocompletamento. Funziona su qualsiasi CPU recente con meno di 2 GB di memoria.
- Falcon H1 1.5B-Deep
- Lo stesso numero di parametri del modello 1.5B, ma molti più strati, meno larghi. TII lo colloca al livello di modelli da 7 a 10 miliardi di parametri. È la variante da provare su un portatile senza GPU.
- Falcon H1 3B
- Il compromesso per una scheda da 4 a 6 GB o un Mac da 16 GB. Riassunto, chat in francese, RAG leggero.
- Falcon H1 7B
- Il modello di fascia media. Compete con Qwen3 8B e supera i modelli da 7B della generazione precedente. Una RTX 3060 12GB lo fa funzionare con un contesto ampio.
- Falcon H1 34B
- Il modello di fascia alta. TII lo confronta con Qwen3 32B, Gemma 3 27B e Llama 4 Scout. Richiede almeno 24 GB di VRAM in Q4, oppure un Mac con 48 GB di memoria unificata per avere un buon margine.
La variante 1.5B-Deep merita qualche parola. TII ha scommesso su un modello stretto ma molto profondo, con quasi il triplo degli strati rispetto al modello 1.5B standard. Il risultato è più lento per token, perché ogni strato viene eseguito in serie, ma nettamente più capace. Su CPU, dove la larghezza di banda della memoria limita tutto, offre spesso il miglior rapporto qualità per gigabyte dell'intera gamma.
#Prerequisiti e VRAM
Sul lato software, ti serve una versione recente di Ollama. Il supporto per l'architettura falcon-h1 è stato aggiunto a llama.cpp nell'estate del 2025 e Ollama lo ha ereditato nelle versioni pubblicate successivamente. Una versione precedente di Ollama rifiuterà di caricare il modello con un errore di architettura sconosciuta. Il daemon è in ascolto per impostazione predefinita su http://localhost:11434; Open WebUI o LM Studio vi si collegano senza configurazioni particolari.
- 0.5B e 1.5B in Q4_K_M
- Meno di 1,5 GB. Basta la CPU con 4 GB di RAM libera. Non serve alcuna GPU.
- 3B in Q4_K_M
- ≈ 2 GB di VRAM. Qualsiasi scheda da 4 GB o più, oppure 8 GB di RAM in modalità CPU.
- 7B in Q4_K_M
- ≈ 5 GB di VRAM per i pesi. RTX 3060 12GB o RTX 4070 12GB offrono un buon margine, anche per un contesto di 32K token o più.
- 7B in Q8_0
- ≈ 8 GB. Per una RTX 4080 da 16 GB o un Mac da 24 GB, se vuoi la massima precisione nelle attività di estrazione.
- 34B in Q4_K_M
- ≈ 20 GB. Una RTX 4090 24GB è al limite: occorre tenere d'occhio la lunghezza del contesto. Un M4 Pro 48 GB o un Mac Studio hanno molto più margine.
- 34B in Q8_0
- ≈ 36 GB. Riservato ai Mac con 64 GB o più, o a un sistema bi-GPU.
#Installare Falcon H1 in locale in base alla propria VRAM
TII pubblica GGUF ufficiali per ogni dimensione su Hugging Face, in repository denominati tiiuae/Falcon-H1-<taille>-Instruct-GGUF. Ollama può scaricare un GGUF direttamente da Hugging Face con il prefisso hf.co, specificando la quantizzazione desiderata dopo i due punti. Controlla anche su ollama.com/library se è apparso un tag ufficiale falcon-h1 da quando è stata scritta questa guida; in tal caso, preferiscilo, perché include un template di chat validato.
- 01Aggiornare OllamaEsegui di nuovo il programma di installazione ufficiale o il tuo gestore di pacchetti, poi verifica la versione. È il passaggio che tutti saltano e che spiega la maggior parte degli errori di caricamento.
- 02Scegliere la dimensione in base alla VRAM12 GB o meno: 7B in Q4_K_M. Da 4 a 6 GB: 3B. Senza GPU: 1.5B-Deep. 24 GB o Mac con 48 GB: 34B. Non scaricare più versioni di dimensioni diverse tutte insieme: ogni GGUF pesa da 1 a 20 GB.
- 03Scaricare il GGUF da Hugging FaceUsa ollama pull con il percorso hf.co del repository e il tag di quantizzazione. Ollama scarica il file, legge i suoi metadati e genera il template di chat a partire da questi.
- 04Avviare una sessione e provare in franceseollama run ouvre un chat interactif. Posez une vraie tâche, résumé d'un texte ou extraction de champs, plutôt qu'une devinette. Vérifiez que le modèle répond en français sans glisser vers l'anglais.
- 05Controlla la distribuzione GPU/CPUollama ps indique le pourcentage du modèle chargé sur le GPU. Si une partie est en CPU, réduisez la taille ou la quantification, sinon le débit s'effondre.
Il nome completo con prefisso hf.co è lungo da digitare e poco leggibile in Open WebUI. Crea un alias locale con un Modelfile: cogli l'occasione per impostare il contesto e un system prompt in francese, e il modello appare con un nome breve in tutte le tue interfacce.
Per l'uso nelle applicazioni, Ollama espone la sua API HTTP sulla stessa porta, con un endpoint compatibile con OpenAI. Qualsiasi client esistente funziona cambiando l'URL di base e il nome del modello.
#Il vantaggio misurato in termini di memoria con contesti lunghi
È la promessa centrale di Falcon H1 in locale, e si verifica in dieci minuti. Il protocollo è semplice: caricare lo stesso modello con due dimensioni di contesto e confrontare la memoria occupata riportata da ollama ps. Con un transformer classico, passare da 8K a 64K token fa aumentare il consumo di diversi gigabyte. Con Falcon H1, l'aumento c'è, perché la componente di attenzione mantiene una cache KV, ma è nettamente più contenuto.
Due precisazioni per interpretare i numeri. Innanzitutto, Ollama riserva in anticipo la cache KV per l'intero contesto richiesto: la memoria visualizzata riflette quindi la capacità riservata, non quella effettivamente utilizzata dal tuo prompt. Inoltre, se hai attivato la quantizzazione della cache KV nella configurazione di Ollama, questa si applica anche alla componente di attenzione di Falcon H1, riducendo ulteriormente la differenza misurata senza però cambiare la conclusione: a parità di VRAM, Falcon H1 accetta un contesto molto più lungo di un transformer delle stesse dimensioni.
In pratica, su una scheda da 12 GB, Falcon H1 7B in Q4_K_M lascia spazio a un contesto di 64K token senza dover ricorrere alla CPU, mentre Qwen3 8B o Mistral 7B obbligano a quantizzare la cache KV o a limitarsi a circa 32K. La velocità di generazione, invece, cala molto meno man mano che il contesto si riempie: la componente Mamba elabora ogni nuovo token in tempo costante.
#Il confronto con Mistral Small e Qwen3: il verdetto
La domanda che tutti si pongono: serve sostituire il modello abituale? La risposta dipende dalla dimensione, perché Falcon H1 non compete nella stessa categoria a seconda della variante.
- Falcon H1 7B contro Qwen3 8B
- La qualità è nel complesso comparabile: Qwen3 mantiene un vantaggio nella programmazione e nel ragionamento strutturato, mentre Falcon H1 è più naturale in francese e soprattutto consuma molte meno risorse quando il contesto si allunga. Per riassumere documenti e chattare in francese con 12 GB, Falcon H1 passa in vantaggio. Per programmare, resta su Qwen3.
- Falcon H1 7B contro Mistral Small 3.2
- Non è la stessa classe: Mistral Small ha 24 miliardi di parametri e richiede da 14 a 15 GB in Q4. Se hai la VRAM necessaria, Mistral Small resta migliore nella maggior parte delle attività. Falcon H1 7B è la scelta quando la scheda ha 12 GB o quando il contesto deve superare i 32K.
- Falcon H1 34B contro Mistral Small 3.2
- Un confronto interessante. Falcon H1 34B è più forte nei benchmark di conoscenza e ragionamento e gestisce meglio i contesti molto lunghi, ma richiede 5 GB in più in Q4 e non ha capacità di visione. Mistral Small entra nella memoria di una scheda da 16 GB, legge le immagini, è distribuito con licenza Apache 2.0 e beneficia di un ecosistema più maturo, soprattutto per il function calling.
- Falcon H1 34B contro Qwen3 32B
- A parità di VRAM, Qwen3 32B resta il punto di riferimento per il codice e gli agenti. Falcon H1 34B è preferibile per documenti lunghi in francese o in arabo e su Mac, dove la memoria unificata ospita i suoi 20 GB senza difficoltà.
Il verdetto si riassume in una frase: Falcon H1 è il miglior modello da installare quando il tuo problema è la memoria con contesti lunghi, o quando il francese e l'arabo sono le tue lingue di lavoro. Non è il miglior modello generalista per ogni situazione e non ha la maturità dell'ecosistema di Mistral o Qwen. Su una workstation con 24 GB, Mistral Small resta la scelta affidabile per un assistente quotidiano; Falcon H1 34B è quello da affiancargli per i documenti di grandi dimensioni.
#Licenza Falcon-LLM: leggere prima di distribuire
Falcon H1 è pubblicato sotto la licenza Falcon-LLM di TII. Questa deriva da Apache 2.0 e permette l'uso commerciale, la modifica e la redistribuzione, ma aggiunge una politica di utilizzo accettabile e alcuni obblighi di attribuzione. Non offre la piena libertà di Apache 2.0, come fanno Mistral Small o Granite, ma non è nemmeno una licenza restrittiva come quella di Llama, con le sue soglie relative al numero di utenti.
Per un uso personale o interno, il problema non si pone. Per un prodotto commerciale redistribuito, dedica dieci minuti a leggere il testo sul sito di TII e a verificare che il tuo caso non rientri negli usi esclusi. Il catalogo del sito indica la licenza per ogni scheda Falcon e la sua versione può variare da una generazione all'altra.
#Risoluzione dei problemi
- Errore unknown model architecture falcon-h1
- La tua versione di Ollama, LM Studio o llama.cpp è troppo vecchia per riconoscere l'architettura ibrida. Aggiornala, riavvia il daemon ed esegui nuovamente il pull. Non ci sono altre soluzioni alternative: i layer Mamba-2 non si caricano senza il supporto del motore.
- Il pull hf.co fallisce o non trova il tag
- Verifica la grafia esatta del repository e della quantizzazione sulla pagina Hugging Face, in particolare le maiuscole e le minuscole di Q4_K_M. Se il repository non offre il tag richiesto, apri la scheda Files per leggere l'elenco dei file GGUF disponibili.
- Risposte in inglese anche se scrivi in francese
- Aggiungi un prompt di sistema che imponga la lingua, come nel Modelfile sopra. Il tokenizer multilingue di Falcon H1 gestisce molto bene il francese, ma l'Instruct senza istruzioni segue a volte la lingua dominante dei suoi dati.
- Velocità molto bassa sul 34B
- ollama ps montre probablement une répartition partielle sur le CPU. En 24 Go, réduisez le contexte à 16K ou passez en Q4_K_S. Sur Mac, augmentez la limite de mémoire GPU allouable si le système en réserve trop.
- Consumo di memoria superiore al previsto con un contesto lungo
- È normale: Ollama riserva la cache KV dell'attenzione per l'intera finestra di contesto dichiarata, anche se vuota. Confronta sempre con un altro modello a parità di contesto e attiva la quantizzazione della cache KV se vuoi risparmiare ancora un po' di memoria.
- Template di chat errato, tag visibili nelle risposte
- Ollama genera il template dai metadati del GGUF. Se compaiono tag, scarica il GGUF ufficiale TII anziché una conversione di terze parti, oppure definisci esplicitamente il TEMPLATE nel tuo Modelfile.
#Per approfondire
Falcon H1 acquista tutto il suo senso una volta comprese a fondo le nozioni di contesto e di memoria che sfrutta. Queste guide del sito completano questa guida:
- Comprendere la finestra di contesto
- Cosa rappresentano 8K, 32K o 256K token, quanta VRAM richiedono e perché la cache KV è il vero collo di bottiglia dei transformer classici.
- Quantizzare la cache KV per risparmiare VRAM
- L'altra leva per estendere il contesto, utilizzabile insieme all'architettura ibrida di Falcon H1.
- Granite 4 di IBM in locale
- L'altro ibrido Mamba del momento, con architettura sequenziale e licenza Apache 2.0. Confrontarlo con Falcon H1 aiuta a capire le scelte di TII.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per scegliere tra Q4_K_M e Q8_0 per ciascuna dimensione di Falcon H1 in base alla tua VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.