Tutto su Granite Guardian di IBM per la conformità IA
Granite Guardian è il classificatore di sicurezza di IBM: un piccolo modello il cui unico compito è leggere un input o un output di un LLM e rispondere «rischioso» o «sicuro». La versione 4.1 (aprile 2026, licenza Apache 2.0) funziona interamente in locale tramite Ollama e copre i rischi specifici degli agenti: jailbreak, chiamate a strumenti allucinate, risposte RAG non fondate. Questa guida mostra come installarlo, invocarlo e collocarlo a monte dei tuoi agenti locali, senza mai inviare un prompt al cloud.
#Perché un meccanismo di protezione locale per i tuoi agenti
Un LLM che risponde in una chat è facile da monitorare: leggi la risposta. Un agente, invece, esegue una sequenza di chiamate a strumenti, legge documenti RAG e prende decisioni senza che nessuno ricontrolli ogni passaggio. È proprio lì che si verificano gli incidenti: un prompt iniettato in un documento attiva un'azione indesiderata, una chiamata a uno strumento viene inventata di sana pianta, una risposta «fattuale» è in realtà un'allucinazione. Hai bisogno di un componente che ispezioni questo flusso continuamente.
Il riflesso abituale è chiamare un'API di moderazione cloud (OpenAI Moderation, Azure Content Safety). Il problema è che hai scelto proprio l'esecuzione in locale per evitare che i tuoi prompt e i tuoi dati escano dalla tua macchina. Inviare ogni messaggio a un servizio di moderazione remoto annulla tutti i vantaggi in termini di riservatezza. Granite Guardian risolve questo paradosso: è un meccanismo di protezione che viene eseguito accanto ai tuoi modelli, sulla stessa macchina.
#Granite Guardian, cosa è esattamente
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Granite Guardian fa parte della famiglia Granite di IBM. È un classificatore di sicurezza addestrato per rilevare contenuti problematici negli input e negli output dei LLM. La versione 4.1 (aprile 2026) è pubblicata con licenza Apache 2.0, che consente l'uso commerciale e la modifica senza royalty — un punto chiave per il deployment in azienda.
- Ruolo
- Rilevatore, non generatore. Riceve un testo e restituisce un segnale di rischio (yes/no + punteggio di probabilità).
- Dimensioni
- Una variante compatta (~2B) per la latenza, una variante più grande (~8B) per risultati più raffinati. La 2B basta per la maggior parte dei controlli di sicurezza in linea.
- Licenza
- Apache 2.0 — uso commerciale, redistribuzione e fine-tuning autorizzati.
- Specialità 4.1
- Rischi agentici: rilevamento di chiamate agli strumenti allucinate e verifica che le risposte RAG siano effettivamente basate sul contesto fornito.
- Formato
- Un prompt strutturato indica il tipo di rischio da valutare; il modello risponde con un verdetto di cui esegui il parsing.
#I rischi che Granite Guardian rileva
Il modello copre due grandi famiglie. Prima i rischi «classici» legati ai contenuti, poi quelli specifici dei sistemi agentici e RAG — è qui che la versione 4.1 si distingue.
- Jailbreak / iniezione
- Tentativi di aggirare le istruzioni di sistema, comprese le iniezioni nascoste in un documento o in una pagina web letta dall'agente.
- Contenuto dannoso
- Violenza, contenuti sessuali, incitamento ad atti pericolosi, discorsi d'odio — sia nell'input sia nell'output.
- Groundedness (RAG)
- La risposta è realmente supportata dai documenti recuperati, oppure il modello ha inventato? Rileva le allucinazioni nel RAG.
- Rilevanza del contesto
- I passaggi recuperati sono veramente collegati alla domanda? Un contesto fuori tema è un segnale di deriva del retriever.
- Allucinazioni nelle chiamate di funzione
- L'agente chiama uno strumento che non esiste o con argomenti incoerenti rispetto a ciò che l'utente ha chiesto?
#Prerequisiti
Granite Guardian gira in parallelo al tuo modello principale, quindi bisogna prevedere anche la sua VRAM oltre a quella dell'agente. La buona notizia: la versione 2B è leggera.
- Ollama installato
- Il daemon ascolta per impostazione predefinita su http://localhost:11434. Consultare la guida all'installazione di Ollama se non è ancora installato.
- VRAM (Guardian 2B, Q4_K_M)
- ≈ 2 GB. Si aggiunge al tuo modello agente. Una RTX 3060 12GB gestisce senza problemi un 7B + il Guardian.
- VRAM (Guardian 8B, Q4_K_M)
- ≈ 5 GB, se vuoi la variante più precisa e hai memoria sufficiente (RTX 4080 16GB, M4 Pro).
- Quantization
- Q4_K_M consigliato per l'equilibrio tra latenza e qualità. Q8_0 se hai margine e vuoi limitare la perdita di qualità nella valutazione del rischio.
#Installare il modello
- 01Verificare che Ollama sia in esecuzioneIl comando `ollama list` deve rispondere senza errori. Altrimenti, avvia il daemon (`ollama serve` su Linux, o l'applicazione su Windows/macOS).
- 02Recuperare il tag ufficialeCerca «granite-guardian» su ollama.com/library e annota il tag esatto della variante 2B. I nomi dei tag cambiano da una versione all'altra: non cercare di indovinarli.
- 03Scaricare il modelloUn semplice `ollama pull` scarica i pesi quantizzati in formato GGUF. Prevedi da 1 a 2 GB di download per la versione 2B.
- 04ConfermareEsegui di nuovo `ollama list`: il modello deve comparire con la sua dimensione. Sei pronto a interrogarlo.
#Prima chiamata al guardrail
Il principio è questo: sottoponi al Guardian il testo da valutare, specificando il tipo di rischio. Il modello restituisce un verdetto che interpreti. La soluzione più semplice è usare l'API di Ollama compatibile con OpenAI, sullo stesso endpoint locale.
#Proteggere un agente: chiamate agli strumenti e RAG
Il vero vantaggio della 4.1 emerge quando supervisioni un agente. Guardian viene collocato in tre punti: prima che l'agente riceva l'input (jailbreak/injection), dopo un recupero RAG (groundedness) e prima di eseguire una chiamata a uno strumento (allucinazione di funzione).
- 01Filtrare l'inputOgni messaggio dell’utente — e ogni documento esterno letto dall’agente — passa prima attraverso il Guardian in modalità jailbreak/iniezione. Un documento web contenente una trappola viene intercettato prima di raggiungere il modello principale.
- 02Verificare il grounding RAGDopo aver recuperato i passaggi, invia al Guardian la domanda, i passaggi e la risposta candidata in modalità groundedness. Se giudica la risposta non fondata, rifiutala o avvia un nuovo recupero dei passaggi.
- 03Verificare il tool-callPrima di eseguire una chiamata a uno strumento, fai valutare la coerenza tra la richiesta dell'utente e lo strumento invocato. Una chiamata allucinata (strumento inesistente, argomenti incoerenti) viene bloccata prima di qualsiasi effetto collaterale.
#Casi d'uso per il GDPR e la conformità
Eseguire la moderazione in locale non è solo una comodità tecnica: è un argomento a favore della conformità. Ai sensi del GDPR e dell'AI Act, ogni trasferimento di dati personali verso un servizio di terzi deve essere giustificato, disciplinato e documentato. Un filtro di sicurezza cloud ti obbligherebbe a far transitare i prompt — potenzialmente pieni di dati personali — verso un ulteriore responsabile del trattamento.
- Nessun trasferimento
- Il testo valutato non lascia mai la tua infrastruttura. Nessun responsabile del trattamento per la moderazione da inserire nel registro dei trattamenti né con cui stipulare un accordo sul trattamento dei dati (DPA).
- Tracciabilità
- Registri localmente ogni verdetto (rischio rilevato, tipo, punteggio). Utile per dimostrare una supervisione effettiva ai sensi dell'AI Act sui sistemi a rischio.
- Minimizzazione
- Il Guardian blocca a monte gli input malevoli che potrebbero esfiltrare dati tramite l'agente, riducendo così la superficie esposta a incidenti.
- Sovranità
- Modello con licenza Apache 2.0 eseguito su hardware sotto il tuo controllo: nessuna dipendenza dalla disponibilità o dalle condizioni di un fornitore esterno.
#Risoluzione dei problemi e consigli
- Verdetto sempre identico
- Se tutte le risposte sono «no», verifica che il tipo di rischio sia stato passato correttamente (ruolo system) e che il tag del modello sia quello giusto. Un modello generico non svolgerà il compito di un Guardian.
- Latenza troppo alta
- Passa dalla 8B alla 2B, quantizza in Q4_K_M e mantieni il modello caricato (keep-alive Ollama) per evitare di ricaricarlo a ogni chiamata.
- Parsing fragile
- Non dare per scontato il formato. Registra l'output grezzo per alcuni giorni in pre-produzione, poi scrivi un parser tollerante (minuscole, trim, prefisso).
- Due modelli in VRAM
- Guardian e l'agente devono rientrare insieme nella VRAM disponibile. Su una scheda da 12 GB, limitati a un agente 7B Q4 + Guardian 2B Q4 (~7 GB totali).
- Falsi positivi fastidiosi
- Adatta il tipo di rischio valutato al tuo uso effettivo invece di attivare tutti i rilevatori. Un meccanismo di protezione troppo zelante finisce per essere disattivato dai team.
#Per approfondire
Granite Guardian si inserisce in un approccio più ampio alla privacy e alla conformità in locale. Tre guide per completare il quadro: la checklist sulla privacy per verificare che nulla fuoriesca dalla tua macchina, la guida su LLM locali e GDPR per il quadro giuridico completo e la guida sull'IA locale in azienda per organizzare un'implementazione conforme.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.