CroissantLLM e Lucie : i modelli 100% francesi in locale
CroissantLLM, Lucie, Pleias, Mistral: la scena francese dei modelli LLM open-weight esiste davvero, e diversi di questi modelli girano agevolmente in locale su un computer consumer. Questa guida offre una panoramica per il 2026 degli LLM 100% francesi che puoi ospitare autonomamente, confronta la loro qualità effettiva in francese con quella dei migliori modelli internazionali (Qwen 3.8, Gemma 4) e spiega quando l'argomento della sovranità giustifica la preferenza per Lucie rispetto a un modello cinese o americano.
#Perché un modello 100% francese?
La maggior parte dei modelli LLM a pesi aperti performanti nel 2026 proviene dalla Cina (Qwen, DeepSeek, GLM) o dagli Stati Uniti (Llama, Gemma, Phi). Parlano spesso molto bene il francese — Qwen 3.8 e Gemma 4 sono infatti eccellenti — ma sono stati addestrati prevalentemente su contenuti in inglese e cinese, con bias culturali che traspaiono: riferimenti impliciti, espressioni americane tradotte con calchi mal riusciti, visione politica, gestione approssimativa dei registri formale e informale.
Un modello addestrato in Francia risponde a tre esigenze distinte: qualità da madrelingua nel francese formale, contenuti culturalmente vicini (diritto, amministrazione, letteratura, media) e sovranità giuridica, nel senso che i pesi, i dataset e gli sviluppatori sono soggetti al diritto europeo. Per uno studio legale, un'amministrazione o un progetto di ricerca pubblico, questo è spesso decisivo.
#Panorama dei LLM francesi nel 2026
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Cinque famiglie dominano oggi il panorama dei modelli francesi che puoi ospitare autonomamente. Differiscono per dimensioni, qualità e licenza.
- Mistral (Mistral AI, Parigi)
- Il migliore. Mistral Small 24B, Magistral, Devstral. Apache 2.0 sui modelli aperti, contesto 128k, qualità FR a livello dei migliori modelli cloud.
- CroissantLLM (Centrale Supélec / Illuin)
- 1,3B bilingue FR-EN realmente open-source: pesi, dataset, codice. Pensato per la ricerca e i sistemi embedded.
- Lucie (LINAGORA / OpenLLM-France)
- 7B Apache 2.0, progetto associativo, addestrato sui supercalcolatori pubblici francesi (Jean Zay). Primo vero modello francese di questa dimensione.
- Pleias (Parigi)
- Famiglia di modelli da 1B a 3B addestrati esclusivamente su dati aperti (Common Corpus). Conformità radicale, perfetta per il settore pubblico.
- Croco / CroissantCool / derivati
- Modelli affinati dalla comunità su istruzioni in francese. Spesso basati su Mistral o CroissantLLM, ospitati su Hugging Face.
Accanto a questi, alcuni modelli non francesi si distinguono in francese: Qwen 3.8 (Alibaba), Gemma 4 (Google), gpt-oss (OpenAI). Più avanti ne contestualizziamo le prestazioni nei benchmark.
#CroissantLLM: 1.3B bilingue, completamente aperto
CroissantLLM è nato da una collaborazione tra CentraleSupélec, Illuin Technology, Inria e INRIA Paris. È un modello da 1,3 miliardi di parametri, addestrato su circa 3 trilioni di token, in parti uguali in francese e inglese. Piccolo, certo, ma la sua unicità risiede nella sua trasparenza totale: pesi, dataset, procedure di addestramento, script di valutazione, tutto è pubblicato.
- Dimensione
- 1,3B parametri, ~800 MB in Q4. Funziona su CPU, smartphone recente, Raspberry Pi 5.
- Lingue
- Bilingue FR-EN equilibrato (1:1 durante l'addestramento).
- Licenza
- MIT, uso commerciale autorizzato senza restrizioni.
- Varianti
- CroissantLLMBase (pre-addestrato), CroissantLLMChat (perfezionato su istruzioni), CroissantCool (addestrato con RLHF comunitario).
- Uso
- Sistemi embedded, edge, ricerca, fine-tuning locale. Non un assistente generalista da confrontare con GPT-5.
#Lucie: la scommessa open-source francese
Lucie è il progetto principale di LINAGORA, in partnership con OpenLLM-France e diversi laboratori pubblici. Presentato all'inizio del 2025, è un modello di 7 miliardi di parametri addestrato sul supercalcolatore Jean Zay del CNRS-IDRIS, su un corpus che mescola francese, inglese, tedesco, spagnolo, italiano e codice, con un peso elevato dei testi in francese.
- Dimensione
- 7B parametri, ~4.5 GB in Q4_K_M, ~5.5 GB in Q5_K_M.
- VRAM
- 5 GB minimo in Q4. Funziona senza difficoltà su una RTX 3060 da 12 GB o su un Mac della serie M con 16 GB di memoria unificata.
- Licenza
- Apache 2.0, quindi utilizzabile a fini commerciali e redistribuibile.
- Contesto
- 32k token nella versione chat (Lucie-7B-Instruct).
- Sovranità
- Pesi ospitati su HuggingFace, ma codice e dati accessibili. Possibilità di mirror auto-ospitato per le amministrazioni.
Ciò che colpisce nell'uso: Lucie produce un francese molto curato, senza il "calco inglese" che si intravede ancora in Llama 4 nelle espressioni letterarie. È invece un gradino sotto i migliori modelli della sua categoria, come Qwen 3.5 9B, nella programmazione e nel ragionamento matematico.
#Pleias: la conformità radicale attraverso i dati
Pleias fa una scelta rara: addestrare i suoi modelli solo su Common Corpus — un dataset pubblico, tracciabile, senza contenuti soggetti a copyright. Il risultato sono modelli da 1B e 3B che un'amministrazione può adottare senza timori per le questioni di proprietà intellettuale, ma che rimangono modesti in termini di capacità rispetto ai grandi modelli addestrati su tutto il web.
- Dimensioni
- Pleias-1B e Pleias-3B (versioni Pico, Nano). RAG-friendly.
- Specialità
- Buoni per compiti RAG, classificazione, estrazione strutturata. Scarsi per chat libera.
- Argomento
- Nessun addestramento su dati protetti dal diritto d'autore. Audit della catena di approvvigionamento possibile.
- Caso d'uso tipico
- Sintesi di documenti pubblici, trattamento di richieste amministrative, classificazione di lettere.
Pleias non è un assistente conversazionale, è uno strumento di estrazione e strutturazione. Per un soggetto pubblico soggetto all'AI Act e a una rigorosa catena di responsabilità, è probabilmente l'unico modello francese che soddisfa tutti i requisiti senza compromessi.
#Mistral: il riferimento francese
Non serve dilungarsi: Mistral resta il leader francese dei modelli a pesi aperti. Mistral Small 24B (Apache 2.0, ollama run mistral-small, 14 GB in Q4) è probabilmente il miglior modello per il francese che puoi ospitare autonomamente nel 2026 su hardware da appassionati. Per il codice, Devstral 24B (Apache 2.0) è lo specialista di casa per gli agenti. Mistral Magistral offre il ragionamento (catena di pensiero) in francese, a cui è dedicata una guida sul sito.
- Mistral Small 24B
- ~14 GB in Q4 (ollama run mistral-small). RTX 4090 o MacBook Pro M3/M4 con 32+ GB. Probabilmente il miglior compromesso FR/qualità.
- Devstral 24B
- ~14 GB in Q4, Apache 2.0 (ollama run devstral:24b). Lo specialista di Mistral AI per gli agenti di programmazione.
- Mistral Magistral 24B
- Ragionamento a catena di pensiero in francese.
- Codestral 22B
- Specializzato nel codice, ma con una licenza che vieta l'uso in produzione: non utilizzabile sul lavoro. Preferisci Devstral 24B.
#Test di qualità FR vs Qwen 3.8 e Gemma 4
Ecco una griglia di valutazione qualitativa per gli usi tipici di un utente francofono (scrittura in registro formale, sintesi di PDF, domande giuridiche generali, codice). Osservazioni effettuate con temperatura 0.3, contesto 8k, Q4_K_M e prompt identici.
- Mistral Small 24B (FR)
- Eccellente nella scrittura, padroneggia il registro formale, rari errori di concordanza. Molto valido nella programmazione. Un riferimento per il francese.
- gpt-oss 20B (US)
- Ottime capacità multilingue, francese al di sopra delle aspettative. Qualche calco dall'inglese nei testi letterari. Molto rapido (MXFP4).
- Qwen 3.8 27B (CN)
- Molto buono nel francese formale, a volte impacciato nel registro colloquiale. Capacità di programmazione al livello di Mistral, ragionamento superiore — ricorda di impostare il ragionamento su low, altrimenti ragiona troppo.
- Lucie 7B (FR)
- Francese corretto, uso fluido del registro amministrativo e formale. Prestazioni nella programmazione nella media. Buono per la redazione e la sintesi.
- Qwen 3.5 9B (CN)
- Solido in FR per le sue dimensioni (8 GB), 256k ctx, visione. Buon compromesso tra scrittura e codice su una configurazione modesta.
- Gemma 4 12B (US)
- FR corretto, a volte troppo scolastico. Multimodale, buon RAG, Apache 2.0.
- CroissantLLM 1.3B (FR)
- Livello di un assistente leggero; non compete nella stessa categoria. Eccellente per le sue dimensioni.
#Sovranità e AI Act
L'AI Act europeo, divenuto applicabile nel 2024-2026, impone diversi obblighi ai fornitori e ai deployer di modelli di IA per finalità generali: documentazione tecnica, sintesi dei dati di addestramento, marcatura dei contenuti generati, valutazione dei rischi sistemici per i modelli molto grandi. I modelli addestrati e pubblicati nell'UE semplificano l'audit, ma l'AI Act non dice che occorre un modello francese — dice che bisogna poter documentare e spiegare il sistema.
- Argomento per l'hosting locale
- Indipendentemente dal modello, eseguirlo localmente risolve il 90% dei problemi relativi al RGPD. Questo punto conta di più della nazionalità del modello.
- La trasparenza come argomento
- Per un audit relativo all'AI Act, un modello i cui dataset sono pubblici (Pleias, CroissantLLM, Lucie) è più facile da difendere rispetto a un modello il cui addestramento è opaco.
- Argomento a favore dell'ecosistema
- Sostenere Mistral, LINAGORA e Pleias significa consolidare una filiera europea. Un argomento politico, ma concreto per gli appalti pubblici.
- Argomento giuridico
- I pesi dei modelli pubblicati sotto licenza Apache 2.0 da un'entità europea riducono l'incertezza sui trasferimenti di dati verso gli Stati Uniti.
#Quale scegliere, a seconda del tuo caso
- 01Sei alle prime armi e vuoi provare un modello FRInstalla Lucie 7B (ollama pull OpenLLM-France/Lucie-7B-Instruct-gguf:Q4_K_M), ~5 GB, un vero modello 100% francese che funziona ovunque. Per un modello generalista in francese più potente, avvia ollama run mistral-small (Mistral Small 24B, 14 GB).
- 02Hai 12 GB di VRAM (RTX 3060/4070)Lucie-7B-Instruct in Q5_K_M per il solo francese, oppure Qwen 3.5 9B in Q8 (11 GB) per un modello generalista più potente. Puoi anche provare Mistral Small 24B in Q3.
- 03Hai 24 GB (RTX 4090/3090, Mac 32+ GB)Mistral Small 24B in Q4_K_M è probabilmente il miglior LLM in francese che puoi ospitare autonomamente, punto. Aggiungi Lucie 7B per utilizzi rapidi «esclusivamente in francese».
- 04Sei un'amministrazione o un soggetto pubblicoPleias 1B/3B per il RAG documentale (zero rischi legati al copyright), Lucie 7B per l'assistenza generale, Mistral Small 24B se hai bisogno di qualità. Evita i modelli con una licenza poco chiara.
- 05Usi sistemi embedded / edge / Raspberry PiCroissantLLM 1.3B Q4. È il modello FR più piccolo che rimane utilizzabile. Consultare la guida agli LLM su Raspberry Pi per i dettagli.
#Per approfondire
Tre percorsi correlati in base al tuo prossimo passo: per approfondire il ragionamento in francese, la guida dedicata a Mistral Magistral illustra in dettaglio la catena di pensiero in francese; per costruire un RAG sui tuoi PDF con uno di questi modelli, la guida al RAG locale con Ollama senza scrivere codice copre l'intero stack; per definire il quadro di conformità in azienda, la guida agli LLM locali e al RGPD esamina gli obblighi dell'AI Act punto per punto.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.