Modelli abliterated (non censurati) in locale: guida pratique
I modelli open-weight come Qwen, Gemma o Mistral sono stati allineati per rifiutare determinate richieste. Un modello abliterated è una variante in cui questo comportamento di rifiuto è stato rimosso chirurgicamente a livello dei pesi — non tramite un prompt di jailbreak, ma modificando la rete. Questa guida spiega cosa fa davvero questa tecnica, dove trovare questi modelli, come eseguirli in locale con Ollama o in formato GGUF e quali sono i veri limiti.
#Che cosa è un modello abliterated
Un modello definito «abliterated» (talvolta «decensored» o «uncensored») è un LLM con pesi aperti a cui è stata rimossa la capacità di rifiutare. Quando chiedi qualcosa che un Qwen 3.5 standard rifiuterebbe con «I cannot help with that», la versione abliterated risponde direttamente, senza messaggi di allineamento, senza preamboli moralizzatori e senza eludere la domanda.
Importante: non si tratta di un jailbreak tramite prompt. Il modello è stato modificato al livello dei suoi pesi. Il rifiuto è diventato meccanicamente impossibile — o comunque estremamente raro — perché si è eliminata la direzione interna che lo attivava.
#Come funziona l'ablazione
Ora sai cosa sia un modello « abliterated ». Il kit IA Senza Filtro inizia con il quadro legale in Francia e in Europa (cap. 4), poi ti insegna a valutare una variante prima di scaricarla (cap. 5 e 6) e a sceglierne una che si adatti alla tua memoria video (cap. 7).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
L'ablazione si basa su un risultato pubblicato nel 2024 da Arditi et al. (« Refusal in Language Models Is Mediated by a Single Direction »). Gli autori mostrano che, nella maggior parte dei LLM allineati, il rifiuto è guidato da un'unica direzione nello spazio delle attivazioni interne: un vettore che si può isolare confrontando le attivazioni su prompt innocui e su prompt che provocano un rifiuto.
L'ablazione consiste nel rimuovere questa direzione dai pesi del modello mediante proiezione, strato per strato. In pratica, si modificano le matrici di proiezione in modo che non possano più produrre la componente associata al rifiuto. Il modello continua a funzionare normalmente, ma il «segnale interno» che lo faceva passare in modalità «mi rifiuto» è stato interrotto.
- Passo 1 — Sondare
- Si inviano al modello decine di coppie di prompt: prompt neutri e prompt che inducono il modello a rifiutare. Si registrano le attivazioni a ogni layer.
- Passo 2 — Isolare
- Si calcola la differenza media delle attivazioni tra i due gruppi. Questo vettore, normalizzato, rappresenta la direzione di rifiuto.
- Passo 3 — Proiettare
- Si modificano i pesi di ogni layer per rendere questa direzione inaccessibile. È una semplice sottrazione di una proiezione ortogonale, non un nuovo addestramento.
- Passo 4 — Testare
- Verifichiamo che il modello non rifiuti più e che le sue capacità generali (ragionamento, codice, FR) non siano crollate.
#Dove trovare modelli abliterated
La maggior parte dell'ecosistema si trova su Hugging Face. Alcuni publisher sono punti di riferimento nella comunità per la qualità delle loro ablazioni:
- mlabonne
- Maxime Labonne, uno dei primi ad aver diffuso questa tecnica. Varianti abliterated di Qwen 3.5, Gemma 4 e Mistral Small — tutte documentate su huggingface.co/mlabonne.
- huihui-ai
- Copre una matrice molto ampia: Qwen 3.5 (da 2B a 27B), Granite 4.2, Gemma 4, GLM 4.7. Varianti indicate come « -abliterated » o « -abliterate ».
- failspy
- Autore di diverse varianti di rilievo (Qwen 3.5 9B abliterated, Gemma 4 12B abliterated). La loro qualità è oggetto di molti commenti.
- Orenguteng / Lexi
- La serie « Lexi-Uncensored » combina ablation e fine-tune leggero. È nota per il suo tono conversazionale.
Per l'uso con Ollama, il registro ufficiale ospita anche numerose varianti: cerca i tag contenenti abliterated o uncensored su ollama.com/library, oppure usa le varianti della community pubblicate da huihui_ai e mlabonne, scaricabili direttamente tramite pull.
#Installazione in Ollama
La strada più semplice per far funzionare un LLM abliterated in locale passa attraverso Ollama. Il daemon ascolta per impostazione predefinita su http://localhost:11434 e accetta le varianti della community senza configurazioni speciali.
- 01Verificare che Ollama sia in esecuzioneEseguire ollama --version in un terminale. Se il comando fallisce, seguire la guida di installazione di Ollama prima di continuare.
- 02Scegliere un modello adatto alla tua VRAMRiprendi questi ordini di grandezza: un 7-8B Q4 occupa circa 5 GB, un 14B circa 9 GB, un 32B circa 19 GB, un 70B circa 40 GB. Una RTX 3060 da 12 GB basta per eseguire comodamente un 8B, una RTX 4090 da 24 GB permette di eseguire i modelli 32B.
- 03Pull e runUsa ollama run con il nome completo della variante. Il modello viene scaricato, poi caricato in VRAM, e la conversazione inizia.
- 04Testare un rifiuto tipicoPoni una domanda che il modello di base rifiuterebbe. Se la variante è stata sottoposta correttamente ad abliteration, ottieni una risposta diretta, senza preamboli.
Una volta caricato il modello, tutto funziona come con qualsiasi altro LLM in Ollama: endpoint compatibile con OpenAI su :11434, integrabile in Open WebUI, Continue.dev, LiteLLM e nei tuoi script Python. Non è richiesta alcuna opzione speciale perché un modello abliterated « funzioni »: l'assenza di rifiuti è nei pesi, non nella configurazione.
#Con GGUF (LM Studio, llama.cpp)
Se preferisci LM Studio o llama.cpp direttamente, lavorerai con file GGUF. La maggior parte delle versioni sottoposte ad ablazione è già disponibile in diverse quantizzazioni su Hugging Face — Q4_K_M resta il compromesso consigliato (qualità preservata, VRAM minima), Q5_K_M se hai margine, Q8_0 se vuoi la massima fedeltà.
- 01Identificare il repo GGUFSu Hugging Face, individua i repository contrassegnati con -GGUF. Ad esempio: mlabonne/Qwen3.5-9B-abliterated-GGUF o bartowski/<modele>-abliterated-GGUF.
- 02Scaricare la quantizzazione correttaIn LM Studio, l'interfaccia filtra per dimensione e per editore. Preferisci Q4_K_M nella maggior parte dei casi. Per i modelli molto piccoli (1-3B), Q5_K_M o Q6_K evitano una perdita significativa.
- 03Caricare e testareLM Studio carica automaticamente i layer sulla GPU se la VRAM è sufficiente. Monitora l'indicatore di offload — se il modello finisce in parte nella RAM di sistema, la velocità cala.
- 04Esporre tramite APIAttiva il server locale compatibile con OpenAI se vuoi collegarlo alle tue app. La porta predefinita è 1234 per LM Studio (contro 11434 per Ollama).
#Limiti e perdita di qualità
L'ablazione ha un costo. Rimuovere una direzione nel residuo modifica tutto ciò che passava attraverso quella direzione, comprese le componenti utili. Gli effetti collaterali osservati nella pratica:
- Leggera diminuzione sui benchmark di ragionamento
- In genere si osserva un calo da 1 a 3 punti su MMLU o GSM8K. È misurabile, ma raramente impedisce l'uso concreto.
- Risposte a volte più meccaniche
- Il modello perde parte delle sfumature dell'allineamento: meno richieste di chiarimento, meno avvertenze anche quando sarebbero utili.
- Allucinazioni appena un po' più frequenti
- In caso di domande in cui il modello avrebbe normalmente risposto «non sono certo», tende a inventare una risposta sicura.
- Comportamenti residui
- Alcuni rifiuti si manifestano comunque, soprattutto quando le ablazioni sono approssimative. Al contrario, alcuni modelli sottoposti ad abliteration molto efficace rispondono a tutto — anche a cose su cui preferiresti che tacessero.
#Rischi e uso responsabile
Un modello che non rifiuta più nulla non è un giocattolo. Alcuni semplici principi prima di integrarlo in un utilizzo concreto:
- Resti responsabile degli output
- Che tu utilizzi un modello allineato, abliterated o in cloud, sei tu a decidere come usare le risposte. Il GDPR, il diritto penale e il diritto d'autore non cambiano in base alla versione del modello.
- Non renderlo accessibile in modalità self-service senza filtri
- Se configuri un endpoint per un team, prevedi almeno un filtro a livello di applicazione (parole chiave, moderazione in uscita). Un modello abliterated senza filtri in una chat interna è, in linea di principio, una cattiva idea.
- Sii trasparente con gli utenti
- Se un'app collegata a un modello abliterated produce contenuti che potrebbero sorprendere, avvisa i tuoi utenti. Niente sorprese, niente processi.
- Uso legittimo, uso reale
- Ricerca sulla sicurezza dell’IA, red-teaming, trattamento di corpora sensibili (medicina, diritto, sicurezza) in cui i rifiuti di un modello allineato rendono lo strumento inutilizzabile: sono questi i casi in cui l’ablazione ha un valore reale. L’approccio «ho rimosso la censura per scherzo» espone a risposte altamente indesiderabili senza alcun beneficio.
#Suggerimenti e risoluzione dei problemi
- Il modello rifiuta comunque
- Alcune ablazioni lasciano ancora emergere rifiuti su temi specifici (politica, medicina, minori). Prova un'altra ablazione dello stesso modello o una versione pubblicata da un altro autore — la qualità dell'ablazione varia molto.
- Il modello è diventato incoerente
- Sintomo di un'ablazione troppo aggressiva (troppe direzioni eliminate o una direzione isolata male). Preferisci una variante di un publisher riconosciuto anziché un'ablazione fatta in proprio e non documentata.
- Scarse prestazioni in francese
- Come per ogni modello a pesi aperti, le prestazioni in francese dipendono dal modello di base. Qwen 3.5, Mistral Small, Gemma 4 e Granite 4.2 sono solidi; i modelli più vecchi (Llama 3, Phi-3, Gemma 2) sono meno performanti. L'ablazione non cambia questo.
- Preamboli residui del tipo « As an AI, I cannot... »
- Piuttosto che un jailbreak, aggiungi un breve system prompt che ricorda il ruolo e il formato atteso. Spesso basta a eliminare i resti di allineamento.
- VRAM saturata
- Con 8 GB, resta su un 7-8B in Q4_K_M. Con 12 GB, puoi passare a Q5_K_M o provare un 14B Q4. Con 24 GB, un 32B Q4 ci sta comodamente.
#Per approfondire
L'ablazione è un punto di partenza per la personalizzazione dei modelli open-weight. Per andare oltre:
- Personalizzare un modello con Ollama Modelfile
- Se vuoi aggiungere un prompt di sistema, parametri e un template a una variante abliterated, il Modelfile è lo strumento da conoscere.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per capire quale GGUF caricare in base alla tua VRAM e alla qualità desiderata — l'ablazione non cambia i compromessi da valutare.
- Fine-tuning di LLM in locale: LoRA e QLoRA
- Se la sola ablazione non ti basta e vuoi adattare il tono o il dominio, un LoRA leggero su una variante abliterated è spesso il miglior compromesso.
Esiste un'IA senza limiti e senza censura?+
Un'IA senza censura in locale è legale?+
Un'IA locale senza limiti è meno intelligente?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.