Intermedio 11 minConformità

IA locale in azienda: GDPR, sovranità e deployment (2026)

Risposta diretta

Un server IA locale in Francia è una macchina dotata di GPU (nei tuoi locali o presso un fornitore di hosting europeo) che esegue un modello open-weight come Mistral Small e lo rende disponibile ai tuoi team tramite un'interfaccia web: i prompt e i documenti restano sotto il tuo controllo. Per una PMI, un progetto pilota può funzionare su una workstation con una GPU da 24 GB. Locale non significa esente dal GDPR: accessi, registrazione dei log, registro dei trattamenti e sicurezza restano a tuo carico.

Vuoi installare un LLM in azienda senza inviare i tuoi dati a un servizio cloud. Questa guida risponde alle domande nell'ordine in cui si presentano: dove posizionare il server, quale modello scegliere (e con quale licenza), quale hardware per quanti utenti, come distribuirlo, proteggerlo e documentarlo per il DPO. I prezzi non sono indicati qui: cambiano ogni settimana.

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux

#Server IA locale in Francia: a cosa serve, per chi

Un server IA locale ospita un modello linguistico su un'infrastruttura che controlli: nei tuoi locali, in un rack presso un fornitore di hosting o su un server GPU noleggiato in Europa. I collaboratori vi accedono tramite un'interfaccia web o un'API interna, con i propri account. Per una PMI, la configurazione iniziale è modesta: una workstation con una GPU da 24 GB, Ollama come motore, Open WebUI come interfaccia e un modello da 24 miliardi di parametri come Mistral Small 3.2, che occupa circa 14 GB in Q4 secondo il catalogo QuelLLM. Decidi poi, sulla base di un caso d'uso reale, se aumentare la potenza o meno.

Privacy
Contratti, dossier clienti, dati delle risorse umane, codice sorgente: i prompt e i file non vengono inviati a un fornitore di IA.
Obblighi di conformità alleggeriti, non eliminati
Nessun responsabile del trattamento per l'IA da indicare né trasferimento fuori dall'UE da documentare per il modello stesso, ma i tuoi obblighi di titolare del trattamento restano.
Costo prevedibile
Nessun abbonamento il cui costo aumenti con il numero di dipendenti: il costo è quello dell'hardware, dell'elettricità e del tempo dedicato all'amministrazione.
Indipendenza
Un modello open-weight scaricato continua a funzionare anche se un fornitore modifica i suoi prezzi o le sue condizioni.

#GDPR e sovranità: cosa cambia con l'esecuzione in locale e cosa non cambia

Il kit IA Locale in Azienda

Implementare un'IA locale sul lavoro: GDPR, AI Act, architettura multiutente, costi, nota per la direzione.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La CNIL ricorda che il RGPD protegge i dati delle persone in tre punti: nei database di addestramento, nei modelli che potrebbero averli memorizzati e nell'uso dei modelli attraverso i prompt. Il tuo server locale risolve la terza questione, quella dei prompt: rimangono presso di te. Non risolve la seconda: un modello linguistico può contenere esso stesso dati personali, il che riguarda la scelta del modello e il modo in cui lo documenti.

Per quanto riguarda i trasferimenti, la CNIL indica che un trasferimento al di fuori dell'Unione europea e dello Spazio economico europeo è possibile solo a condizione di garantire un livello di protezione sufficiente e appropriato. Con un server nei tuoi locali, la questione non si pone. Con un fornitore di hosting, si pone a seconda della sua struttura e delle sue filiali.

!
Locale non significa esente dal GDPR
Rimani responsabile del trattamento: base giuridica, informazione delle persone, minimizzazione, periodo di conservazione delle cronologie delle conversazioni, gestione degli accessi e registrazione delle attività. Aggiungi l'assistente al registro dei trattamenti e, se il trattamento presenta un rischio elevato, fai valutare insieme al tuo DPO la necessità di una valutazione d'impatto.

#LLM privato ospitato in Francia: le opzioni concrete

Tre architetture permettono di ospitare un LLM privato, in base al livello di controllo desiderato. La tabella le confronta sugli aspetti che contano davvero: dove si trovano i dati, chi si occupa dell'amministrazione e cosa devi dimostrare a un auditor.

Tre modi per ospitare un LLM privato
OpzioneDove sono i datiChi gestisceAspetto da tenere presente
Server nei tuoi locali (on-premise)Da te, sulla tua rete internaVousIl più semplice da difendere di fronte a un DPO; investimento iniziale e gestione operativa a tuo carico
Server GPU noleggiato da un provider europeoPresso il provider di hosting, nella regione sceltaIl fornitore di hosting per l'hardware, tu per il softwareVerifica la regione effettiva, il contratto di trattamento dei dati e la struttura del fornitore di hosting
Postazione di lavoro o mini-PC potenteSul computerVousIdeale per un progetto pilota; nessuna ridondanza, nessuna alta disponibilità

#Ospitato in Francia, in Europa, SecNumCloud: tre cose diverse

«Ospitato in Francia» descrive un luogo, non una protezione giuridica. Scaleway, ad esempio, mette in evidenza per le sue istanze GPU una residenza dei dati garantita in Europa e una protezione contro le leggi extraterritoriali: si tratta di impegni commerciali da leggere nel contratto, non di fatti che questa guida può verificare al posto tuo. Per i dati più sensibili, l'ANSSI propone la qualificazione SecNumCloud, che mira a proteggere i dati e i trattamenti sensibili dalla minaccia della criminalità informatica e dall'applicazione di leggi extraterritoriali.

Due precisazioni utili prima di farvi affidamento. Da un lato, l'ANSSI sottolinea che questa qualificazione non permette di dedurre il livello di sicurezza dei servizi che ospiti sull'offerta qualificata: la tua applicazione deve comunque essere messa in sicurezza. Dall'altro, l'ANSSI qualifica specifiche offerte cloud, non un fornitore di hosting nel suo insieme: consulta il catalogo dei prodotti e servizi qualificati per verificare che vi figuri l'offerta GPU che stai considerando.

i
Se ti rivolgi a un provider di hosting, chiedi queste quattro risposte per iscritto
Regione esatta del server GPU; società contraente e società affiliate con accesso da amministratore; contratto di trattamento dei dati conforme all'articolo 28 del RGPD; offerta coperta o meno da una qualificazione SecNumCloud.

#Quale modello per un'azienda francese e con quale licenza

La scelta si basa su tre criteri: la qualità in francese, la memoria necessaria e la licenza. La licenza è il criterio che si dimentica: l'uso commerciale di un modello molto valido può essere vietato. Il catalogo QuelLLM mostra la licenza di ogni modello; ecco alcuni riferimenti per modelli francesi o europei.

Modelli francesi o europei per un uso aziendale (catalogo QuelLLM)
ModelloDimensioneMemoria in Q4LicenzaNota
Mistral Nemo 12B Instruct12B7 GBApache 2.0Contesto di 128.000 token; buon punto di partenza su una scheda modesta
Mistral Small 3.2 24B24B14 GBApache 2.0Multilingue, visione; equilibrio tra qualità e costo per una PMI
EuroLLM 22B Instruct22,6B13 GBApache 2.0Modello europeo; contesto di 32.768 token
Mistral Small 4119B (MoE)72 GBApache 2.0Riservato a un server con molta memoria
Codestral 22B v0.122B13 GBMistral Non-Production LicenseNon per uso commerciale: controlla prima di ogni deploy

Il modello da 32 miliardi di parametri spesso citato come « buon compromesso » occupa da 19 a 20 GB in Q4, considerando solo i pesi: su una scheda da 24 GB, lascia pochissimo spazio per il contesto e per più utenti contemporaneamente. Per un primo deployment, un modello da 24 miliardi di parametri è una base più realistica. Prova il francese sui tuoi documenti prima di decidere: la qualità riportata in una classifica non permette di prevedere la qualità sul gergo del tuo settore.

#Budget e hardware: dimensionare in base agli utenti contemporanei

Il corretto dimensionamento non dipende dal numero di dipendenti, ma dal numero di persone che inviano una richiesta contemporaneamente. Secondo la FAQ di Ollama, un modello elabora per impostazione predefinita una richiesta alla volta; le altre attendono in coda, e la memoria richiesta cresce in proporzione al prodotto del numero di richieste parallele per la lunghezza del contesto. Consentire quattro richieste parallele con un contesto di 8.000 token alloca quindi l'equivalente di 32.000 token di memoria di contesto.

Indicazioni per il dimensionamento (da verificare con un test basato sui tuoi casi d'uso)
SituazioneA cosa puntareSoluzione software da valutare
Progetto pilota con da 1 a 5 persone, uso occasionaleWorkstation con GPU da 24 GB o Mac con molta memoria unificata; modello da 12 a 24BOllama e Open WebUI
Team di qualche decina di persone, uso quotidianoServer GPU dedicato con più memoria; misurare la latenza con utenti realiOllama con il parallelismo configurato, oppure un server ad alto throughput come vLLM
Più sedi, disponibilità richiestaDue server, un gateway, supervisioneLiteLLM o equivalente come livello di accesso a più motori

Queste righe sono riferimenti architetturali, non misurazioni: la latenza percepita dipende dal modello, dalla quantizzazione, dal contesto e dal profilo d'uso. Realizza un progetto pilota della durata di due-quattro settimane con un caso d'uso preciso, osserva le code e l'occupazione della memoria, poi procedi al dimensionamento.

#Chatbot interno e RAG documentale

L'uso più redditizio è il chatbot collegato alla tua base documentale: il RAG, in cui l'assistente risponde basandosi sulle tue procedure, sui contratti o sulla documentazione tecnica recuperati al momento. Open WebUI, AnythingLLM e PrivateGPT offrono questa funzionalità chiavi in mano. Fai attenzione alla licenza dell'interfaccia: Open WebUI vieta di rimuovere il proprio marchio oltre i cinquanta utenti in una finestra mobile di trenta giorni, salvo autorizzazione o licenza enterprise. Questo riguarda direttamente un deployment aziendale con un'interfaccia personalizzata.

Secondo punto: il RAG non sostituisce i diritti di accesso. Se tutti i dipendenti interrogano la stessa base, un documento riservato alla direzione deve restare inaccessibile agli altri. Separa le collezioni per gruppo e verifica il risultato con un account privo di autorizzazioni.

#Sicurezza del deployment

Il punto di partenza è semplice: secondo la FAQ di Ollama, Ollama è in ascolto per impostazione predefinita su 127.0.0.1, porta 11434. Finché non modifichi OLLAMA_HOST, è raggiungibile solo dalla macchina stessa. Il pericolo si presenta quando lo apri alla rete affinché l'interfaccia, su un altro server, possa raggiungerlo, senza alcuna protezione interposta.

Isolamento di rete
Server su rete interna, accesso solo tramite interfaccia; isolamento completo (air-gap) per i dati più sensibili.
Gestione degli accessi
Autenticazione, ruoli, disattivazione dell'iscrizione libera, registrazione delle richieste nell'interfaccia.
Crittografia
Cifra i dischi che contengono i modelli, le raccolte documentali e le cronologie delle conversazioni.
Aggiornamenti
Segui le versioni del motore, dell'interfaccia e dei modelli; documenta chi è responsabile.
Backup e cancellazione
Decidi la durata di conservazione delle conversazioni e la procedura di cancellazione su richiesta di una persona.

#Soluzioni consigliate e deploy in sette fasi

  1. 01
    Definire un caso d'uso
    Scegli un uso preciso (supporto, documentazione interna) e la categoria dei dati coinvolti prima di scegliere l'hardware.
  2. 02
    Scegliere l'hosting
    Locali aziendali, provider di hosting europeo o postazione di lavoro, in base alla sensibilità dei dati e alla tabella delle opzioni.
  3. 03
    Scegliere il modello
    Verifica la licenza, prova il francese sui tuoi documenti e tieni presente la memoria necessaria.
  4. 04
    Installare il motore e l'interfaccia
    Ollama e Open WebUI per un progetto pilota, un server ad alto throughput per un carico maggiore.
  5. 05
    Mettere in sicurezza
    Account, ruoli, HTTPS dietro un reverse proxy, porta del motore non esposta, dischi crittografati.
  6. 06
    Documentare
    Registro dei trattamenti, informativa agli interessati, periodo di conservazione, contratto con il responsabile del trattamento se si ricorre a un fornitore di hosting.
  7. 07
    Misurare con un progetto pilota
    Da due a quattro settimane di utilizzo reale, poi la decisione se aumentare la scala di utilizzo.

Il software di questo stack è gratuito, ma lo stack non è conforme «per progettazione»: è l'uso che ne fai, documentato e controllato, a essere conforme. Tieni traccia delle tue scelte; è ciò che chiederà un auditor.

Domande frequenti
L'IA locale è conforme al RGPD?+
Semplifica la conformità, perché i tuoi prompt e documenti non vengono inviati a un fornitore incaricato del trattamento, ma non la garantisce. Resti responsabile del trattamento: base giuridica, informativa, minimizzazione, durata di conservazione, accessi e registrazione degli eventi. Aggiungi il trattamento al registro e fai valutare con il tuo DPO la necessità di un'analisi d'impatto.
Come installare un LLM in azienda?+
Definisci un caso d'uso, scegli l'hosting, poi un modello la cui licenza consenta l'uso commerciale. Installa Ollama e un'interfaccia come Open WebUI, attiva gli account e la registrazione dei log, cifra i dischi e documenta il trattamento. Esegui test per un periodo da due a quattro settimane prima di dimensionare la capacità necessaria per l'aumento del carico.
È possibile ospitare un LLM privato in Francia?+
Sì: nei tuoi locali, presso un provider di hosting europeo che garantisca la regione, oppure su una postazione di lavoro per un progetto pilota. Verifica la regione esatta, il contratto con il responsabile del trattamento e, per i dati sensibili, se l'offerta in questione possiede la qualificazione SecNumCloud dell'ANSSI. «Ospitato in Francia» non basta da solo.
Quale server per una IA locale in azienda?+
Dipende dal numero di richieste simultanee, non dal numero di dipendenti. Un progetto pilota può essere eseguito su una workstation con una GPU da 24 GB e un modello da 12 a 24 miliardi di parametri. Per qualche decina di utenti, prevedi più memoria e misura la latenza durante un progetto pilota prima di acquistare.
Esiste un LLM francese privato?+
Sì: i modelli Mistral (Nemo, Small) sono francesi e sono sotto licenza Apache 2.0 nel catalogo QuelLLM, EuroLLM è un modello europeo. Attenzione alla licenza di ogni modello: ad esempio, Codestral 22B è sotto licenza non commerciale. Prova il francese sui tuoi documenti prima di scegliere.
Serve esporre Ollama sulla rete aziendale?+
La cosa migliore è non esporlo: Ollama è in ascolto per impostazione predefinita su 127.0.0.1. Se l'interfaccia è su un altro server, apri la porta solo verso quel server, usando un firewall, e fai passare gli utenti attraverso l'interfaccia autenticata dietro un reverse proxy in HTTPS. Non aprire mai la porta del motore su Internet.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.