IA locale in azienda: GDPR, sovranità e deployment (2026)
Un server IA locale in Francia è una macchina dotata di GPU (nei tuoi locali o presso un fornitore di hosting europeo) che esegue un modello open-weight come Mistral Small e lo rende disponibile ai tuoi team tramite un'interfaccia web: i prompt e i documenti restano sotto il tuo controllo. Per una PMI, un progetto pilota può funzionare su una workstation con una GPU da 24 GB. Locale non significa esente dal GDPR: accessi, registrazione dei log, registro dei trattamenti e sicurezza restano a tuo carico.
Vuoi installare un LLM in azienda senza inviare i tuoi dati a un servizio cloud. Questa guida risponde alle domande nell'ordine in cui si presentano: dove posizionare il server, quale modello scegliere (e con quale licenza), quale hardware per quanti utenti, come distribuirlo, proteggerlo e documentarlo per il DPO. I prezzi non sono indicati qui: cambiano ogni settimana.
#Server IA locale in Francia: a cosa serve, per chi
Un server IA locale ospita un modello linguistico su un'infrastruttura che controlli: nei tuoi locali, in un rack presso un fornitore di hosting o su un server GPU noleggiato in Europa. I collaboratori vi accedono tramite un'interfaccia web o un'API interna, con i propri account. Per una PMI, la configurazione iniziale è modesta: una workstation con una GPU da 24 GB, Ollama come motore, Open WebUI come interfaccia e un modello da 24 miliardi di parametri come Mistral Small 3.2, che occupa circa 14 GB in Q4 secondo il catalogo QuelLLM. Decidi poi, sulla base di un caso d'uso reale, se aumentare la potenza o meno.
- Privacy
- Contratti, dossier clienti, dati delle risorse umane, codice sorgente: i prompt e i file non vengono inviati a un fornitore di IA.
- Obblighi di conformità alleggeriti, non eliminati
- Nessun responsabile del trattamento per l'IA da indicare né trasferimento fuori dall'UE da documentare per il modello stesso, ma i tuoi obblighi di titolare del trattamento restano.
- Costo prevedibile
- Nessun abbonamento il cui costo aumenti con il numero di dipendenti: il costo è quello dell'hardware, dell'elettricità e del tempo dedicato all'amministrazione.
- Indipendenza
- Un modello open-weight scaricato continua a funzionare anche se un fornitore modifica i suoi prezzi o le sue condizioni.
#GDPR e sovranità: cosa cambia con l'esecuzione in locale e cosa non cambia
Implementare un'IA locale sul lavoro: GDPR, AI Act, architettura multiutente, costi, nota per la direzione.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La CNIL ricorda che il RGPD protegge i dati delle persone in tre punti: nei database di addestramento, nei modelli che potrebbero averli memorizzati e nell'uso dei modelli attraverso i prompt. Il tuo server locale risolve la terza questione, quella dei prompt: rimangono presso di te. Non risolve la seconda: un modello linguistico può contenere esso stesso dati personali, il che riguarda la scelta del modello e il modo in cui lo documenti.
Per quanto riguarda i trasferimenti, la CNIL indica che un trasferimento al di fuori dell'Unione europea e dello Spazio economico europeo è possibile solo a condizione di garantire un livello di protezione sufficiente e appropriato. Con un server nei tuoi locali, la questione non si pone. Con un fornitore di hosting, si pone a seconda della sua struttura e delle sue filiali.
#LLM privato ospitato in Francia: le opzioni concrete
Tre architetture permettono di ospitare un LLM privato, in base al livello di controllo desiderato. La tabella le confronta sugli aspetti che contano davvero: dove si trovano i dati, chi si occupa dell'amministrazione e cosa devi dimostrare a un auditor.
| Opzione | Dove sono i dati | Chi gestisce | Aspetto da tenere presente |
|---|---|---|---|
| Server nei tuoi locali (on-premise) | Da te, sulla tua rete interna | Vous | Il più semplice da difendere di fronte a un DPO; investimento iniziale e gestione operativa a tuo carico |
| Server GPU noleggiato da un provider europeo | Presso il provider di hosting, nella regione scelta | Il fornitore di hosting per l'hardware, tu per il software | Verifica la regione effettiva, il contratto di trattamento dei dati e la struttura del fornitore di hosting |
| Postazione di lavoro o mini-PC potente | Sul computer | Vous | Ideale per un progetto pilota; nessuna ridondanza, nessuna alta disponibilità |
#Ospitato in Francia, in Europa, SecNumCloud: tre cose diverse
«Ospitato in Francia» descrive un luogo, non una protezione giuridica. Scaleway, ad esempio, mette in evidenza per le sue istanze GPU una residenza dei dati garantita in Europa e una protezione contro le leggi extraterritoriali: si tratta di impegni commerciali da leggere nel contratto, non di fatti che questa guida può verificare al posto tuo. Per i dati più sensibili, l'ANSSI propone la qualificazione SecNumCloud, che mira a proteggere i dati e i trattamenti sensibili dalla minaccia della criminalità informatica e dall'applicazione di leggi extraterritoriali.
Due precisazioni utili prima di farvi affidamento. Da un lato, l'ANSSI sottolinea che questa qualificazione non permette di dedurre il livello di sicurezza dei servizi che ospiti sull'offerta qualificata: la tua applicazione deve comunque essere messa in sicurezza. Dall'altro, l'ANSSI qualifica specifiche offerte cloud, non un fornitore di hosting nel suo insieme: consulta il catalogo dei prodotti e servizi qualificati per verificare che vi figuri l'offerta GPU che stai considerando.
#Quale modello per un'azienda francese e con quale licenza
La scelta si basa su tre criteri: la qualità in francese, la memoria necessaria e la licenza. La licenza è il criterio che si dimentica: l'uso commerciale di un modello molto valido può essere vietato. Il catalogo QuelLLM mostra la licenza di ogni modello; ecco alcuni riferimenti per modelli francesi o europei.
| Modello | Dimensione | Memoria in Q4 | Licenza | Nota |
|---|---|---|---|---|
| Mistral Nemo 12B Instruct | 12B | 7 GB | Apache 2.0 | Contesto di 128.000 token; buon punto di partenza su una scheda modesta |
| Mistral Small 3.2 24B | 24B | 14 GB | Apache 2.0 | Multilingue, visione; equilibrio tra qualità e costo per una PMI |
| EuroLLM 22B Instruct | 22,6B | 13 GB | Apache 2.0 | Modello europeo; contesto di 32.768 token |
| Mistral Small 4 | 119B (MoE) | 72 GB | Apache 2.0 | Riservato a un server con molta memoria |
| Codestral 22B v0.1 | 22B | 13 GB | Mistral Non-Production License | Non per uso commerciale: controlla prima di ogni deploy |
Il modello da 32 miliardi di parametri spesso citato come « buon compromesso » occupa da 19 a 20 GB in Q4, considerando solo i pesi: su una scheda da 24 GB, lascia pochissimo spazio per il contesto e per più utenti contemporaneamente. Per un primo deployment, un modello da 24 miliardi di parametri è una base più realistica. Prova il francese sui tuoi documenti prima di decidere: la qualità riportata in una classifica non permette di prevedere la qualità sul gergo del tuo settore.
#Budget e hardware: dimensionare in base agli utenti contemporanei
Il corretto dimensionamento non dipende dal numero di dipendenti, ma dal numero di persone che inviano una richiesta contemporaneamente. Secondo la FAQ di Ollama, un modello elabora per impostazione predefinita una richiesta alla volta; le altre attendono in coda, e la memoria richiesta cresce in proporzione al prodotto del numero di richieste parallele per la lunghezza del contesto. Consentire quattro richieste parallele con un contesto di 8.000 token alloca quindi l'equivalente di 32.000 token di memoria di contesto.
| Situazione | A cosa puntare | Soluzione software da valutare |
|---|---|---|
| Progetto pilota con da 1 a 5 persone, uso occasionale | Workstation con GPU da 24 GB o Mac con molta memoria unificata; modello da 12 a 24B | Ollama e Open WebUI |
| Team di qualche decina di persone, uso quotidiano | Server GPU dedicato con più memoria; misurare la latenza con utenti reali | Ollama con il parallelismo configurato, oppure un server ad alto throughput come vLLM |
| Più sedi, disponibilità richiesta | Due server, un gateway, supervisione | LiteLLM o equivalente come livello di accesso a più motori |
Queste righe sono riferimenti architetturali, non misurazioni: la latenza percepita dipende dal modello, dalla quantizzazione, dal contesto e dal profilo d'uso. Realizza un progetto pilota della durata di due-quattro settimane con un caso d'uso preciso, osserva le code e l'occupazione della memoria, poi procedi al dimensionamento.
#Chatbot interno e RAG documentale
L'uso più redditizio è il chatbot collegato alla tua base documentale: il RAG, in cui l'assistente risponde basandosi sulle tue procedure, sui contratti o sulla documentazione tecnica recuperati al momento. Open WebUI, AnythingLLM e PrivateGPT offrono questa funzionalità chiavi in mano. Fai attenzione alla licenza dell'interfaccia: Open WebUI vieta di rimuovere il proprio marchio oltre i cinquanta utenti in una finestra mobile di trenta giorni, salvo autorizzazione o licenza enterprise. Questo riguarda direttamente un deployment aziendale con un'interfaccia personalizzata.
Secondo punto: il RAG non sostituisce i diritti di accesso. Se tutti i dipendenti interrogano la stessa base, un documento riservato alla direzione deve restare inaccessibile agli altri. Separa le collezioni per gruppo e verifica il risultato con un account privo di autorizzazioni.
#Sicurezza del deployment
Il punto di partenza è semplice: secondo la FAQ di Ollama, Ollama è in ascolto per impostazione predefinita su 127.0.0.1, porta 11434. Finché non modifichi OLLAMA_HOST, è raggiungibile solo dalla macchina stessa. Il pericolo si presenta quando lo apri alla rete affinché l'interfaccia, su un altro server, possa raggiungerlo, senza alcuna protezione interposta.
- Isolamento di rete
- Server su rete interna, accesso solo tramite interfaccia; isolamento completo (air-gap) per i dati più sensibili.
- Gestione degli accessi
- Autenticazione, ruoli, disattivazione dell'iscrizione libera, registrazione delle richieste nell'interfaccia.
- Crittografia
- Cifra i dischi che contengono i modelli, le raccolte documentali e le cronologie delle conversazioni.
- Aggiornamenti
- Segui le versioni del motore, dell'interfaccia e dei modelli; documenta chi è responsabile.
- Backup e cancellazione
- Decidi la durata di conservazione delle conversazioni e la procedura di cancellazione su richiesta di una persona.
#Soluzioni consigliate e deploy in sette fasi
- 01Definire un caso d'usoScegli un uso preciso (supporto, documentazione interna) e la categoria dei dati coinvolti prima di scegliere l'hardware.
- 02Scegliere l'hostingLocali aziendali, provider di hosting europeo o postazione di lavoro, in base alla sensibilità dei dati e alla tabella delle opzioni.
- 03Scegliere il modelloVerifica la licenza, prova il francese sui tuoi documenti e tieni presente la memoria necessaria.
- 04Installare il motore e l'interfacciaOllama e Open WebUI per un progetto pilota, un server ad alto throughput per un carico maggiore.
- 05Mettere in sicurezzaAccount, ruoli, HTTPS dietro un reverse proxy, porta del motore non esposta, dischi crittografati.
- 06DocumentareRegistro dei trattamenti, informativa agli interessati, periodo di conservazione, contratto con il responsabile del trattamento se si ricorre a un fornitore di hosting.
- 07Misurare con un progetto pilotaDa due a quattro settimane di utilizzo reale, poi la decisione se aumentare la scala di utilizzo.
Il software di questo stack è gratuito, ma lo stack non è conforme «per progettazione»: è l'uso che ne fai, documentato e controllato, a essere conforme. Tieni traccia delle tue scelte; è ciò che chiederà un auditor.
- Fonte: CNIL, trasferimento dei dati fuori dall'UE
- Fonte: ANSSI, qualificazione SecNumCloud
- Fonte: Scaleway, istanze GPU
- Fonte: FAQ Ollama
L'IA locale è conforme al RGPD?+
Come installare un LLM in azienda?+
È possibile ospitare un LLM privato in Francia?+
Quale server per una IA locale in azienda?+
Esiste un LLM francese privato?+
Serve esporre Ollama sulla rete aziendale?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.