Miglior LLM on-premise per le aziende nel rispetto del GDPR nel 2026
Scegliere un LLM GDPR on-premise è diventato un tema centrale per le direzioni tecniche europee che vogliono industrializzare l'elaborazione dei documenti senza esporre i propri dati a un fornitore SaaS extraeuropeo. Un LLM conforme al RGPD, correttamente distribuito on-premise, garantisce che i prompt, gli output e gli eventuali log non escano mai dal perimetro controllato dall'azienda, semplificando notevolmente le valutazioni d'impatto sulla protezione dei dati (DPIA) e gli obblighi previsti dall'articolo 32 del regolamento. Questo articolo passa in rassegna i modelli open-weights pertinenti nel 2026, le loro esigenze hardware, le loro licenze, i loro casi d'uso e gli aspetti operativi a cui prestare attenzione prima della messa in produzione.
Perché un LLM RGPD on-premise piuttosto che un'API gestita
Il regolamento (UE) 2016/679 (vedi il testo consolidato su EUR-Lex) impone un rigoroso controllo dei trasferimenti al di fuori dell'UE e una chiara dimostrazione delle basi giuridiche del trattamento. Un'API ospitata da un fornitore terzo introduce sistematicamente un ulteriore responsabile del trattamento, clausole contrattuali tipo (CCT) da mantenere e, in alcuni casi, un'esposizione a leggi extraterritoriali come il CLOUD Act. Al contrario, un'implementazione on-premise (o in un cloud privato sotto il controllo dell'azienda) elimina questa catena di dipendenze.
Tre altre motivazioni ricorrono nei riscontri sul campo:
- Sovranità contrattuale : nessuna variazione dei termini e condizioni del fornitore può interrompere il servizio.
- Controllo del fine-tuning : i corpus aziendali interni rimangono nel SI, evitando così i rischi di fuga attraverso gli embedding.
- Costo marginale prevedibile : una volta ammortizzato l'hardware, l'inferenza non dipende più dal prezzo per milione di token.
L'ecosistema open-weights, elencato su hub come Hugging Face o attraverso i server di inferenza vLLM, permette oggi di coprire quasi tutti i casi d’uso professionali senza dipendenze esterne. Per una panoramica più ampia delle architetture, vedere anche la nostra guida all'uso di LLM open-source in azienda.
Quali modelli open-weights scegliere nel 2026
La scelta di un LLM sovrano per le imprese dipende da un compromesso tra qualità intrinseca, dimensione del contesto, licenza e consumo di VRAM. Ecco una selezione rappresentativa tratta dal nostro catalogo completo, classificata per profilo d'uso.
Profilo "data center ad alta densità" (>200 GB di VRAM in Q4)
- DeepSeek V4 Pro 1.6T : 1600 miliardi di parametri, licenza MIT, contesto di 1.000.000 di token, VRAM Q4 stimata a ~960 GB. Impiego previsto: RAG documentale su vasta scala su archivi giuridici o normativi.
- MiMo V2.5 Pro : 1020B, MIT, contesto 1M, VRAM Q4 ~595 GB. Buona versatilità multilingue.
- Mistral Large 3 675B : 675B, Apache 2.0, contesto 256.000, VRAM Q4 ~405 GB. Vantaggio francese: produttore con sede a Parigi, hosting interamente controllabile nell'UE.
- GLM-5.1 : 744B, MIT, contesto 200.000, VRAM Q4 ~445 GB.
- Llama 4 Maverick 400B : 400B, licenza Llama 4 Community (attenzione alle clausole di uso commerciale oltre 700M MAU), contesto 1M.
Profilo "cluster intermedio" (60-200 GB VRAM Q4)
- Qwen 3 235B-A22B : 235B con architettura mixture-of-experts (22B attivi), Apache 2.0, contesto 131 072. Eccellente rapporto qualità/costo di inferenza grazie al MoE.
- MiniMax-M2.7 : 229B, Apache 2.0, contesto 205 000.
- Mixtral 8x22B Instruct : 141B (39B attivi), Apache 2.0, contesto 64 000. Solido riferimento europeo per i carichi di lavoro RAG.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, contesto 262.000.
- gpt-oss 120B : 117B, Apache 2.0, contesto 128 000.
- Llama 4 Scout 109B : 109B, licenza Llama 4 Community, contesto di 10M token (da confermare in pratica su prompt molto lunghi).
Profilo "server con una sola GPU" (20-60 GB di VRAM in Q4)
- Llama 3.3 70B Instruct : 70B, licenza Llama 3.3 Community, contesto 128 000. Rientra nella memoria di due RTX 6000 Ada o di una H100 80 GB in Q4.
- Apertus 70B : 70B, Apache 2.0, contesto 65 536. Modello di origine svizzera, interessante per le organizzazioni che cercano un produttore europeo in senso ampio.
- Mixtral 8x7B : 47B, Apache 2.0, contesto 32 768. Ancora valido per carichi di lavoro batch che non richiedono soluzioni all'avanguardia.
- Salamandra 40B Instruct : 40B, Apache 2.0, contesto 8192. Sviluppato dal Barcelona Supercomputing Center, addestrato su un corpus multilingue europeo.
- Qwen 3 32B et Qwen 2.5 Coder 32B : 32B, Apache 2.0. Impieghi previsti: RAG generalista e assistente interno per il codice.
Per un confronto più dettagliato nel segmento 70B, vedere Llama 3.3 70B vs Mixtral 8x22B.
Consumo di VRAM, quantizzazione e throughput
La stima della VRAM dipende dalla quantizzazione scelta. In prima approssimazione, per un modello denso:
- FP16 : circa 2 byte per parametro
- Q8 : ~1 byte per parametro
- Q5_K_M : ~0,7 byte per parametro (stima)
- Q4_K_M : da ~0,55 a 0,60 byte per parametro
Per le architetture MoE come Mixtral 8x22B Instruct o Qwen 3 235B-A22B, la VRAM necessaria corrisponde alla memorizzazione di tutti gli esperti, anche se solo alcuni sono attivati per token. È la memoria a limitare, non il calcolo. Il paper Mixtral 8x7B su arXiv dettaglia questo meccanismo.
Per quanto riguarda il throughput, i valori in token/sec variano notevolmente a seconda del motore di inferenza (vLLM, TensorRT-LLM, llama.cpp, SGLang), la lunghezza del contesto effettivo e il batching. Alcuni ordini di grandezza osservati (da confermare sul tuo carico di lavoro):
- Llama 3.3 70B Q4 su un H100 da 80 GB con vLLM: ~35-50 token/sec con un singolo flusso, diverse centinaia in batch.
- Mixtral 8x7B Q4 su RTX 4090 24 GB con offload parziale: ~20-30 token/sec (stimato).
- Qwen 3 30B-A3B Q4 su RTX 6000 Ada 48 GB: circa 60-80 token/sec in single-stream (stima), favorito dall'architettura MoE.
- DeepSeek R1 671B Q4 su un nodo con 8×H200: ~15-25 token/sec con un singolo flusso (da confermare in base alla versione di inferenza).
Per dimensionare con precisione un server, il configuratore quelllm.fr incrocia GPU, RAM e modelli compatibili.
Licenze: ciò che cambia veramente in produzione
Une IA conforme al RGPD non basta: serve anche una licenza compatibile con il tuo modello economico. Tre famiglie dominano:
- Apache 2.0 (Mistral, Qwen, gpt-oss, Mixtral, Snowflake, MiniMax, IBM Granite, BSC Salamandra…) : uso commerciale libero, redistribuzione autorizzata, clausola di protezione dei brevetti. È la licenza più semplice per un deploy aziendale.
- MIT (DeepSeek V3.2, R1, V4 Pro, GLM-5.1, Ling 2.6, MiMo, Ring-1T, dots.llm1, Seed-OSS): ancora più permissiva, ma senza una clausola esplicita sui brevetti.
- Llama Community (Meta): uso commerciale autorizzato, salvo oltre 700 milioni di utenti attivi mensili, con clausole sull'uso accettabile. Consultabile sul sito Llama.
- Gemma (Google): commerciale, ma con una politica sugli usi vietati da rispettare.
Per le organizzazioni che cercano la tracciabilità massima, OLMo 3 32B di Allen AI pubblica anche i suoi set di training, il che facilita alcuni audit (vedi il blog Allen AI). Sul fronte europeo, Mistral Large 3 675B et Apertus 70B sono le opzioni fondamentali. Maggiori dettagli sulla nostra pagina migliore LLM francese.
Benchmark e casi d'uso per un LLM aziendale auto-ospitato
I punteggi pubblici devono essere trattati con cautela: le metodologie variano e la contaminazione dei set di test è ora documentata. Alcuni riferimenti tratti dalle schede dei modelli Hugging Face:
- MMLU (conoscenze generali 5-shot): i modelli >200B raggiungono tipicamente l'85-89%. DeepSeek R1 671B, Qwen 3 235B-A22B et Mistral Large 3 675B si trovano in questa fascia (da confermare in base alla pipeline di valutazione).
- HumanEval / MBPP (codice Python) : Qwen 2.5 Coder 32B et Qwen3-Coder-Next 80B-A3B sono candidati validi per un assistente interno alla programmazione.
- AIME 2024/2025 (ragionamento matematico) : DeepSeek R1 671B, QwQ 32B et Ring-1T sono posizionati in questo settore "reasoning".
- Long-context (RULER, LongBench) : Llama 4 Scout 109B, Seed-OSS 36B Instruct (524.288 token) e MiMo V2.5 Pro si distinguono con contesti estesi.
Casi d'uso tipici per la direzione IT:
- RAG documentale interno : 32-70B sono più che sufficienti. Vedi migliore LLM per RAG e il nostro guida RAG on-premise.
- Assistente giuridico / conformità : preferire un contesto ≥ 128 000 token e un modello multilingue solido (Mistral Large 3, Qwen 3 235B).
- Generazione di codice : Qwen 2.5/3 Coder, Laguna XS.2, DeepSeek R2 32B.
- Multimodale : Qwen 3 VL 235B-A22B, Molmo 72B, LLaVA-OneVision 72B per l'analisi di documenti scansionati.
- Carichi di lavoro leggeri ed edge : Granite 4.0 H-Small 32B-A9B, Gemma 4 31B, Qwen 3 30B-A3B.
Vedi anche il nostro confronto DeepSeek R1 vs Llama 3.3 70B per scegliere tra ragionamento e costo hardware.
Architettura target: dal POC alla produzione
Un deployment on-premise robusto si articola in quattro livelli:
- Livello hardware : GPU NVIDIA (H100/H200/B200, RTX 6000 Ada, L40S) o alternative AMD MI300X. Per carichi di lavoro >400B, un nodo con 8×H100 80 GB o 8×H200 141 GB è il minimo realistico.
- Strato di inferenza : vLLM o SGLang per il throughput, TensorRT-LLM per la latenza, llama.cpp per i server senza GPU dedicata. La documentazione vLLM copre la maggior parte dei modelli citati qui.
- Layer di orchestrazione : Kubernetes con il NVIDIA operatore GPU, KEDA per lo scaling e un gateway come LiteLLM o Envoy per l'unificazione delle API compatibili con OpenAI.
- Strato di conformità : registrazione crittografata dei prompt con un breve periodo di conservazione, mascheramento dei dati personali identificabili (PII) in ingresso (Presidio, raccomandazioni CNIL sull'IA), registro dei trattamenti aggiornato, AIPD documentata.
Dal punto di vista dell'osservabilità, strumenti come Langfuse o OpenTelemetry permettono di tracciare le catene RAG senza inviare i log a un SaaS. Per un approccio strutturato, consulta la nostra guida al deployment degli LLM in produzione e la checklist per la sicurezza dei LLM.
FAQ
Q: Un LLM open-weights scaricato da Hugging Face è automaticamente conforme al RGPD?
No. La licenza del modello e il luogo in cui viene eseguito sono due questioni distinte. Scaricare i pesi di Mistral Large 3 o DeepSeek R1 ed eseguirli in un datacenter europeo sotto il tuo controllo elimina il trasferimento fuori dall'UE dei dati degli utenti, ma resti responsabile dei trattamenti (articolo 24 del GDPR): valutazione d'impatto sulla protezione dei dati, tempi di conservazione, diritti delle persone, sicurezza degli accessi.
Q: Quale quantizzazione scegliere per un LLM conforme al RGPD on-premise senza degradare la qualità?
Per la produzione, Q5_K_M o Q4_K_M offrono il migliore equilibrio qualità/VRAM sui modelli >30B secondo le valutazioni della comunità pubblicate su Hugging Face. Con quantizzazioni inferiori (Q3, Q2), la perdita diventa misurabile nelle attività di ragionamento. Per gli impieghi sensibili soggetti a regolamentazione, Q8 o FP16 restano consigliati se la VRAM lo permette, soprattutto sui modelli <70B.
Q: È possibile fare fine-tuning su dati personali nel rispetto della normativa?
Sì, a condizione di documentare la base giuridica, la valutazione d'impatto sulla protezione dei dati (DPIA) e la conservazione dei dati. I modelli sotto licenza Apache 2.0 (Mistral, Qwen, gpt-oss, IBM Granite) o MIT (DeepSeek, GLM) autorizzano esplicitamente il fine-tuning commerciale. LoRA e QLoRA permettono di mantenere gli adattatori separati dai pesi di base, il che facilita la cancellazione su richiesta di un interessato se il corpus lo giustifica.
Q: Mixtral 8x22B o Llama 3.3 70B per iniziare?
Mixtral 8x22B Instruct consuma più VRAM (82 GB Q4 contro 40 GB) ma beneficia di una licenza Apache 2.0 più semplice da integrare legalmente rispetto alla Llama Community License. Llama 3.3 70B Instruct resta molto solido in francese e nelle attività generaliste. Per un primo progetto interno, Llama 3.3 70B è spesso più accessibile dal punto di vista hardware; per un prodotto redistribuibile, Mixtral è più semplice sul piano della licenza.
Q: Serve un cluster H100 per un LLM ospitato autonomamente in azienda?
Non sempre. Un server con 2×RTX 6000 Ada 48 GB o un H100 80 GB basta per eseguire Llama 3.3 70B o Qwen 3 32B in Q4 su carichi di lavoro RAG di un team. Un cluster multi-GPU diventa necessario per modelli >100B a piena precisione o >400B quantizzati. Il configuratore quelllm.fr calcola l'hardware minimo necessario.
D: I modelli di origine cinese (DeepSeek, Qwen, GLM, MiMo) pongono un problema rispetto al GDPR?
Il RGPD riguarda il trattamento dei dati, non l'origine dei pesi. Un modello DeepSeek eseguito localmente non comunica con un server di terzi: è un file di parametri. Gli obblighi da verificare sono la licenza (MIT per DeepSeek, Apache 2.0 per Qwen) e le eventuali restrizioni settoriali interne. La verifica di sicurezza (analisi statica dei pesi, sandboxing) resta consigliata come per qualsiasi artefatto esterno.
Conclusione
Adottare un LLM GDPR on-premise nel 2026 non è più un progetto esplorativo: l'ecosistema open-weights copre tutti i profili di carico, da Qwen 3 30B-A3B su una singola GPU a DeepSeek V4 Pro 1.6T su un cluster denso, con licenze Apache 2.0 o MIT compatibili con l'uso in produzione. La vera difficoltà si sposta sul dimensionamento dell'hardware e sull'industrializzazione. Per identificare il modello adatto al tuo hardware e ai tuoi vincoli, avvia il configuratore o sfoglia il catalogo completo dei 249 modelli indicizzati.