Migliore LLM open-source per il settore giuridico 2026
Scegliere un LLM giuridico open source nel 2026 risponde a un'esigenza professionale precisa: mantenere il controllo dei dati dei clienti, rispettare il segreto professionale e distribuire un modello con licenza permissiva sull'infrastruttura interna. Questa guida confronta i modelli open-weights più pertinenti per gli studi legali, gli uffici legali e le legaltech francofoni, con specifiche hardware, licenze verificabili e casi d'uso adatti al diritto francese. Di seguito troverai una selezione tratta dal catalogo quelllm.fr, una panoramica delle famiglie Mistral, DeepSeek, Qwen e Llama, raccomandazioni sulla VRAM in base alle dimensioni dell'organizzazione, poi una FAQ che risponde alle domande sulle licenze, sul GDPR e sulla riservatezza.
Perché un LLM open source per il settore giuridico
Il settore giuridico tratta dati sensibili: fascicoli dei clienti, accordi, atti processuali, giurisprudenza non pubblicata. Ospitare un modello sui propri server (o su un cloud sovrano) elimina la trasmissione dei prompt a terzi e facilita la conformità al RGPD nonché agli obblighi dell'AI Act europeo entrato progressivamente in applicazione dal 2024.
Tre vantaggi concreti per una IA per studi legali ospitata su infrastruttura propria:
- Privacy : nessun prompt esce dal perimetro dello studio legale, il che tutela il segreto professionale garantito dall'articolo 66-5 della legge del 1971.
- Fine-tuning di settore : adattamento possibile su un corpus giurisprudenziale interno (sentenze delle corti d'appello, dottrina, modelli di conclusioni).
- Costi controllati : nessun costo per token, il costo si riduce all'infrastruttura GPU e all'energia.
I modelli con licenza Apache 2.0 o MIT sono da preferire: consentono l'uso commerciale, la modifica e la redistribuzione senza clausola di condivisione obbligatoria. Le licenze comunitarie (Llama, Gemma) rimangono utilizzabili ma richiedono un esame contrattuale — vedi il guida alle licenze open-weights.
Modelli consigliati per la redazione giuridica in francese
Il francese giuridico rimane un ambito in cui pochi modelli eccellono in zero-shot. Gli attori europei e i grandi modelli multilingui offrono i migliori risultati.
Famiglia Mistral — l'opzione francese
- Mistral Large 3 675B (Apache 2.0, Mistral AI) — 675 miliardi di parametri, ~405 GB di VRAM in Q4, contesto di 256.000 token. Progettato in Francia, padroneggia la sintassi giuridica in lingua francese e accetta documenti molto lunghi (memorie, conclusioni, contratti consolidati). Scheda: Mistral Large 3.
- Mistral Small 4 (Apache 2.0) — 119B, ~72 GB di VRAM in Q4, contesto 256 000. Buon compromesso per uno studio di medie dimensioni dotato di 2× A100 80GB o 4× RTX 6000 Ada. Scheda: Mistral Small 4.
- Mixtral 8x22B Instruct (Apache 2.0) — 141B (39B attivi in MoE), ~82 GB VRAM Q4. Soluzione Mistral giuridico robusta, già collaudata in diversi deployment legaltech. Scheda: Mixtral 8x22B.
- Mixtral 8x7B (Apache 2.0) — 47B, ~26 GB VRAM Q4. Il più accessibile per iniziare (1× RTX 4090 + offload CPU possibile). Dettagli: Mixtral 8x7B.
Mistral AI pubblica i suoi tokenizer e i pesi su HuggingFace, il che semplifica l'audit interno.
Famiglia Qwen — performante e multilingue
Alibaba pubblica una gamma Qwen sotto Apache 2.0 le cui performance multilingue includono il francese.
- Qwen 3 235B-A22B (~142 GB di VRAM in Q4, ctx 131 072) — architettura MoE con 22B parametri attivi, adatta alla sintesi di sentenze lunghe. Scheda: Qwen 3 235B.
- Qwen 3.5 122B-A10B (~73 GB VRAM Q4, ctx 262.000) — 10B attivi, latenza ridotta per la redazione interattiva.
- Qwen 3 32B (~19 GB di VRAM in Q4) — eseguibile su una sola RTX 4090 o A6000. Scheda: Qwen 3 32B.
- Qwen 3 VL 235B-A22B — variante con capacità visive per l'OCR di documenti scansionati e la lettura di tabelle. Scheda: Qwen 3 VL 235B.
Vedi il confronto Mistral Large 3 vs Qwen 3 235B per scegliere tra padronanza nativa del francese e versatilità multilingue.
Famiglia DeepSeek — ragionamento prolungato
DeepSeek si distingue nel ragionamento strutturato, utile per l'analisi dei motivi giuridici, le qualificazioni giuridiche e la costruzione di argomentazioni.
- DeepSeek V3.2 (MIT, 685B, ~410 GB VRAM Q4, ctx 128 000) — scheda: DeepSeek V3.2.
- DeepSeek R1 671B (MIT, ~400 GB VRAM Q4) — modello di ragionamento pubblicato con l'articolo R1 su arXiv. Scheda: DeepSeek R1 671B.
- DeepSeek R1 Distill 32B (~19 GB di VRAM in Q4) — versione distillata per server con una sola GPU. Scheda: DeepSeek R1 Distill 32B.
- DeepSeek R2 32B (~19 GB VRAM Q4, ctx 128 000) — iterazione 2026 con ragionamento migliorato.
Specifiche hardware in base alle dimensioni dello studio legale
La VRAM necessaria dipende dalla quantizzazione scelta. Regola approssimativa (da confermare in base all'implementazione llama.cpp o vLLM) :
- Q4 (4 bit): ~0,60 GB per miliardo di parametri
- Q5 : ~0,75 GB / B
- Q8 : ~1,20 GB / B
- FP16 : ~2,00 GB / B
Studio individuale o piccola struttura (da 1 a 5 avvocati)
Budget GPU 2 000–6 000 €, 1× RTX 4090 24 GB o 1× RTX 6000 Ada 48 GB :
- Qwen 3 30B-A3B (~19 GB Q4, 3B attivi in MoE — latenza molto bassa) — fiche
- Mixtral 8x7B Q4 (~26 GB, offload parziale)
- Gemma 4 31B (Gemma license, ~18 GB Q4, ctx 256 000) — fiche
- Qwen 3.6 35B-A3B (~21 GB Q4)
Vedere miglior LLM per 24 GB di VRAM per la selezione completa.
Studio legale di medie dimensioni (da 10 a 50 avvocati)
Server 2× A100 80GB o 4× L40S 48GB :
- Mistral Small 4 Q4 ~72 GB
- Mixtral 8x22B Q4 ~82 GB
- Qwen 3.5 122B-A10B Q4 ~73 GB
- gpt-oss 120B (Apache 2.0, OpenAI) ~70 GB — fiche
Grande ufficio legale o legaltech
Cluster di 8× H100 80GB (640 GB di VRAM aggregata) o 4× MI300X 192 GB:
- Mistral Large 3 675B Q4 ~405 GB
- DeepSeek V3.2 ~410 GB Q4
- Llama 4 Maverick 400B (~240 GB Q4, ctx 1 000 000) — fiche
Per le architetture multi-GPU e tensor parallelism, consultare il guida all'inferenza distribuita e la documentazione vLLM.
Benchmark pertinenti per il diritto
Nessun benchmark pubblico valuta specificamente il diritto francese, ma diversi proxy sono utilizzabili :
- MMLU (sottocategorie
professional_lawetinternational_law) — copre principalmente il diritto americano ma funge da indicatore. Riferimento: articolo scientifico su MMLU. - LegalBench (progetto HuggingFace) — 162 compiti giuridici in inglese.
- MMLU-Pro — versione più impegnativa, utile per la qualificazione giuridica con ragionamento a catena.
Su queste valutazioni (dati pubblici da confermare in base alle versioni):
- Mistral Large 3 : MMLU stimato ~86 %
- DeepSeek V3.2 : MMLU ~88 %, MMLU-Pro ~75 %
- Qwen 3 235B-A22B : MMLU ~87 %
- Llama 3.3 70B Instruct : MMLU ~82 %, ctx 128 000 — fiche
Per confrontare codice e ragionamento (utile per automatizzare le attività di legal ops e l'analisi delle clausole), vedere migliore LLM per il codice et miglior LLM per il ragionamento.
Casi d'uso concreti in studio
- Sintesi degli atti processuali : Mistral Large 3 o Qwen 3.5 122B-A10B, contesto ≥ 200.000 token che consente di acquisire un intero dossier.
- Stesura di una prima bozza (comparse conclusionali, lettere, pareri legali): Mistral Small 4 o Mixtral 8x22B, sufficienti per produrre una bozza rivista dall'avvocato.
- Ricerca giurisprudenziale supportata da RAG : pipeline Qwen 3 32B + database vettoriale Légifrance/Doctrine, che può essere distribuita su un unico server.
- Analisi di contratti e rilevamento di clausole : DeepSeek R2 32B o QwQ 32B per la decomposizione logica degli impegni — scheda QwQ 32B.
- Anonimizzazione automatica delle decisioni : Granite 4.0 H-Small 32B-A9B (Apache 2.0, IBM, ~19 GB Q4) — fiche.
- OCR e lettura di documenti scansionati : Qwen 3 VL 235B-A22B per la multimodalità documentale.
Un progetto europeo sovrano merita una menzione: Apertus 70B (Swiss AI, Apache 2.0, ~40 GB Q4) — fiche — addestrato con particolare attenzione alla conformità europea e alle lingue ufficiali svizzere, tra cui il francese.
Performance di inferenza (token/sec)
Stime per configurazioni comuni (da confermare in base al runtime e alla dimensione del batch) :
- Mixtral 8x7B Q4 su RTX 4090 tramite llama.cpp: ~40–60 tok/s con un singolo flusso di generazione
- Qwen 3 32B Q4 sulla RTX 6000 Ada tramite vLLM: ~35-50 tok/s
- Mistral Small 4 Q4 su 2× A100 80GB tramite vLLM: ~25-40 tok/s
- Mistral Large 3 Q4 su 8× H100 80GB: ~15-30 tok/s, con un throughput molto superiore nell'elaborazione in batch
Vedere i metodi di misura del collettivo llama.cpp per i protocolli di benchmark riproducibili.
FAQ
Q: Quale licenza scegliere per mettere un modello in produzione per uso commerciale in uno studio?
Preferire Apache 2.0 (Mistral, Qwen, Mixtral, gpt-oss, Apertus) o MIT (DeepSeek). Queste licenze autorizzano esplicitamente l'uso commerciale, la modifica e la redistribuzione senza clausole di condivisione obbligatoria. Le licenze comunitarie Llama e Gemma sono utilizzabili, ma impongono limiti al numero di utenti (Llama) o restrizioni d'uso (Gemma) che è opportuno riesaminare con la direzione legale prima del deployment.
Q: Un LLM open source ospitato internamente è conforme al GDPR?
L'hosting autonomo elimina il trasferimento dei dati a terzi, risolvendo già una parte importante dei rischi. La conformità finale dipende tuttavia dalla valutazione d'impatto (AIPD), dal registro dei trattamenti e dai tempi di conservazione dei prompt e dei completamenti. Il deployment self-hosted facilita la conformità, ma non basta a garantirla pienamente — resta necessario un audit da parte del DPO.
Q: Quanta VRAM serve per Mistral Large 3?
Con quantizzazione Q4, Mistral Large 3 675B richiede circa 405 GB di VRAM aggregata, cioè 6× H100 80GB o 3× MI300X 192GB. In Q8 (più preciso), prevedere circa 810 GB. Per una qualità quasi equivalente con un'occupazione di memoria ridotta, Mixtral 8x22B (~82 GB Q4) o Mistral Small 4 (~72 GB Q4) rappresentano alternative ragionevoli.
Q: Quale modello per il diritto francese con una sola GPU da 24 GB?
Con 24 GB di VRAM (RTX 4090, RTX 3090), i migliori candidati sono Qwen 3 30B-A3B (~19 GB Q4, bassa latenza grazie al MoE), Mixtral 8x7B Q4 (~26 GB con offload leggero), Gemma 4 31B (~18 GB Q4) o DeepSeek R2 32B (~19 GB Q4). Vedi la selezione dettagliata su miglior LLM per 24 GB di VRAM.
Q: È possibile fare un fine-tuning di un modello sulla propria giurisprudenza?
Sì, tramite LoRA o QLoRA su modelli con licenza Apache 2.0 o MIT. Prevedi da 24 a 80 GB di VRAM in base alla dimensione del modello di base e al rank LoRA scelto. I modelli MoE (Mixtral, Qwen MoE) richiedono precauzioni particolari per il routing. Vedi il guida al fine-tuning giuridico per le buone pratiche sui corpus annotati.
Q: È meglio preferire un modello denso o un modello MoE in uno studio legale?
Un modello dense (Llama 3.3 70B, Qwen 3 32B) offre una qualità omogenea e un'integrazione RAG semplice. Un modello MoE (Mixtral 8x22B, Qwen 3 235B-A22B) offre un migliore rapporto qualità/costo di inferenza perché solo gli esperti attivi consumano risorse di calcolo, ma richiede più VRAM totale per caricare tutti gli esperti. Per un uso interattivo (scrittura assistita), il MoE è vantaggioso; per l'elaborazione in batch (analisi su larga scala), il modello denso rimane competitivo.
Conclusione
La scelta di un LLM giuridico open source nel 2026 si basa su tre assi: licenza permissiva (con priorità ad Apache 2.0 o MIT), qualità in lingua francese (Mistral in testa, seguito da Qwen e DeepSeek) e budget GPU realistico (dalla RTX 4090 al cluster H100). Per affinare la tua selezione in base alla VRAM disponibile e al tuo caso d'uso specifico, avvia il configuratore quelllm.fr o sfoglia il catalogo completo dei 249 modelli indicizzati.