SillyTavern: l'interfaccia per personaggi per i modelli LLM locale
SillyTavern è un'interfaccia web pensata per il gioco di ruolo e la scrittura interattiva con un LLM. Non esegue direttamente alcun modello: si collega a un backend locale come KoboldCpp o Ollama e aggiunge tutto ciò che manca alla chat classica — schede dei personaggi, memoria persistente del mondo, controllo dettagliato del prompt ed estensioni. Questa guida copre l'installazione, la connessione al tuo backend, la creazione dei personaggi e le impostazioni che fanno la differenza nell'interpretazione dei personaggi.
#Perché SillyTavern piuttosto che una chat classica
Un'interfaccia come Open WebUI o LM Studio tratta ogni conversazione come un'interazione tra assistente e utente. SillyTavern parte da un altro bisogno: incarnare un personaggio coerente per centinaia di messaggi, in un universo che ricorda le proprie regole. È lo strumento di riferimento della comunità dei giochi di ruolo con LLM locale e offre meccaniche che una semplice chat non ha.
- Schede dei personaggi
- Un formato standardizzato (PNG con metadati incorporati) che descrive persona, stile, esempi di dialogo e messaggio di benvenuto. Importabile e condivisibile in un file.
- Memoria del mondo
- Il lorebook inserisce informazioni nel prompt solo quando appare una parola chiave, mantenendo così un universo coerente senza saturare il contesto.
- Controllo del prompt
- Vedi e modifichi ogni componente inviato al modello: prompt di sistema, formato delle istruzioni, ordine di inserimento. Nulla è nascosto.
- Backend a scelta
- SillyTavern è un front-end puro. Lo stesso personaggio gira su KoboldCpp, Ollama, llama.cpp o su un'API remota senza dover riscrivere nulla.
#Prerequisiti e scelta del backend
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
SillyTavern funziona su Node.js (versione 18 o successiva) su Windows, macOS e Linux. Richiede poche risorse — è il backend a consumare la VRAM. Due backend locali coprono quasi tutti gli usi: KoboldCpp, orientato a GGUF e al gioco di ruolo, e Ollama, più generalista.
- KoboldCpp
- Un unico binario che esegue modelli GGUF con un'API supportata nativamente da SillyTavern. Impostazioni dettagliate per la memoria, supporto per AMD ROCm. La scelta predefinita della comunità RP.
- Ollama
- Il daemon ascolta su http://localhost:11434. È comodo se lo usi già per altro; SillyTavern vi si collega tramite il suo endpoint compatibile.
- llama.cpp (llama-server)
- Server HTTP compatibile con OpenAI per un controllo massimo sull'offloading dei layer.
- VRAM
- In Q4_K_M: un 7B entra in circa 5 GB, un 14B in circa 9 GB, un 32B in circa 19 GB. Per un RP fluido, punta almeno a un 12-14B se la tua scheda lo permette.
#Installare SillyTavern
Il metodo consigliato è la clonazione con Git: rende gli aggiornamenti semplicissimi (basta un git pull) e SillyTavern evolve rapidamente. Assicurati di avere Node.js 18+ e Git installati.
- 01Clonare il repositoryScarica il ramo release, stabile e testato. Evita il ramo staging, a meno che tu non voglia le novità in anteprima al prezzo di qualche bug.
- 02Avviare lo script di avviostart.sh sotto Linux/macOS, Start.bat sotto Windows. Al primo avvio, npm installa automaticamente le dipendenze.
- 03Aprire l'interfacciaSillyTavern rende disponibile la sua interfaccia su http://localhost:8000. Apri questo indirizzo nel tuo browser; non c'è alcuna applicazione desktop da installare.
- 04Aggiornare più tardiUn git pull nella cartella, poi riavvia lo script. I tuoi personaggi e le tue conversazioni sono salvati separatamente in data/ e non vengono sovrascritti.
#Collegare il backend locale
Una volta aperto SillyTavern, tutto si svolge nella scheda di connessione API (l'icona a forma di spina in alto). Il principio: avviare il backend da un lato, indicarne l'indirizzo a SillyTavern dall'altro.
#Con KoboldCpp
Avvia KoboldCpp con il tuo modello GGUF; espone la sua API sulla porta 5001 per impostazione predefinita. In SillyTavern, scegli il tipo di API «Text Completion», poi il backend «KoboldCpp» e inserisci l'URL. Clicca su Connect: se tutto è corretto, compare il nome del modello caricato.
#Con Ollama
Ollama è già in esecuzione come daemon sulla porta 11434. In SillyTavern, seleziona «Text Completion», poi il backend «Ollama», inserisci l'indirizzo e scegli il modello dall'elenco a discesa recuperato automaticamente.
#Creare e importare le carte dei personaggi
La scheda del personaggio è il cuore di SillyTavern. È un file PNG la cui immagine funge da avatar e i cui metadati incorporati descrivono il personaggio. Puoi crearne una da zero o importare una scheda condivisa dalla comunità.
#I campi che contano
- Descrizione
- La base del personaggio: aspetto, tratti, storia. Viene inserita costantemente nel contesto, quindi scrivi in modo conciso e concreto, senza dilungarti.
- Personality
- Un riassunto del temperamento. Utile per orientare il tono senza riscrivere tutta la descrizione.
- First message
- Il messaggio di benvenuto che introduce la scena. Definisce il tono, lo stile di scrittura e il formato attesi: il modello tende a imitarne la forma.
- Example dialogues
- Esempi di battute che mostrano al modello come parla il personaggio. Molto efficace per mantenere una voce particolare.
- Scenario
- Il contesto della scena, separato dalla descrizione del personaggio. Pratico per riutilizzare lo stesso personaggio in diverse situazioni.
- 01Aprire il pannello dei personaggiL'icona del personaggio nella barra superiore apre l'elenco. Il pulsante «+» crea una scheda vuota.
- 02Compilare la descrizioneDescrivi il personaggio in modo dettagliato. Molti autori usano un formato strutturato (elenco di caratteristiche) piuttosto che un paragrafo, cosa che i modelli seguono bene.
- 03Scrivere il primo messaggioCuralo: è il tuo strumento migliore per orientare lo stile. Un messaggio di benvenuto narrativo in terza persona spinge il modello verso questo formato.
- 04Importare una scheda esistenteTrascina un PNG di una scheda personaggio nell'elenco, oppure importalo. Le schede vengono condivise come semplici file immagine sugli hub della community.
#Mondo persistente: il lorebook
Il lorebook (o World Info) risolve il problema centrale delle partite lunghe: come mantenere un universo coerente senza iniettare tutto in continuazione. Il principio è l'iniezione condizionata per parole chiave.
Crei delle voci, ciascuna associata a una o più parole chiave. Quando una di queste parole appare nei messaggi recenti, la voce corrispondente viene inserita nel contesto subito prima della generazione. Per il resto del tempo non occupa spazio. In questo modo puoi descrivere decine di luoghi, personaggi secondari e regole senza mai saturare il prompt.
- Input
- Un blocco di testo (il lore da iniettare) e le parole chiave che lo attivano. Esempio: parola chiave «Valmont» → descrizione della città di Valmont.
- Costante vs selettivo
- Una voce può essere sempre attiva (regole fondamentali dell'universo) oppure attivata solo da una parola chiave (dettagli contestuali).
- Profondità di inserimento
- Scegli in quale posizione la voce viene inserita nel prompt, il che influisce sul peso che il modello le attribuisce.
- Relativo al personaggio o globale
- Un lorebook può accompagnare una scheda specifica o applicarsi a tutte le tue conversazioni come universo condiviso.
#Regolare la generazione per l'interpretazione
I parametri di sampling determinano l'equilibrio tra coerenza e creatività. Per il gioco di ruolo si cerca più varietà che per l'assistenza fattuale, senza cadere nell'incoerenza. Queste impostazioni si trovano nella scheda dei parametri di generazione (l'icona con i cursori).
- Temperatura
- Il cursore creatività/stabilità. Intorno a 0,7-0,9 per un buon equilibrio nel gioco di ruolo. Un valore troppo alto (> 1,2) porta a incoerenze; uno troppo basso rende il personaggio ripetitivo e piatto.
- Min-P
- Un sampler moderno che esclude i token improbabili in proporzione al token più probabile. Un valore di 0.05-0.1 ripulisce l'output e permette di aumentare la temperatura senza andare fuori strada.
- Penalità di ripetizione
- Penalizza la ripetizione degli stessi token. Utile contro i loop, ma un valore troppo alto costringe il modello a usare formulazioni artificiali. Mantieni un valore moderato.
- Response length
- Il numero massimo di token generati per risposta. 200-400 token per battute narrative sostanziose senza monologhi interminabili.
- Context size
- Deve corrispondere a ciò che il tuo backend ha caricato. Non serve chiedere 16k a SillyTavern se KoboldCpp è stato avviato soltanto con 8k.
#Le estensioni che modificano l'esperienza
SillyTavern è estendibile. Alcune estensioni sono incluse di default, altre vengono installate tramite l'URL del repository. Ecco quelle che trasformano veramente l'uso.
- Vector Storage (riepilogo della memoria)
- Vettorizza la cronologia e reinserisce i passaggi pertinenti dei vecchi messaggi, estendendo la memoria oltre la finestra di contesto. Utile per le partite molto lunghe.
- Summarize
- Genera e mantiene un riassunto aggiornato della conversazione, reinserito nel prompt. Il personaggio ricorda gli eventi principali anche dopo centinaia di messaggi.
- Text-to-Speech
- Dà una voce ai personaggi tramite un motore TTS locale. Maggiore immersione per chi gioca a voce.
- Generazione di immagini
- Si collega a un backend locale per le immagini (come Stable Diffusion) per illustrare scene e personaggi al volo dalla chat.
- Espressioni
- Mostra l'avatar con un'emozione che corrisponde al tono del messaggio, a partire da un set di sprite del personaggio.
#Quali modelli locali eccellono nell'interpretazione
Non tutti i LLM si equivalgono nel gioco di ruolo. I modelli «instruct» allineati per l'assistenza tendono a uscire dal personaggio, a fare la morale o a rifiutare scenari di finzione. La comunità privilegia modelli con fine-tuning specializzato, spesso costruiti su basi solide e poi riaddestrati per la narrazione e il dialogo nei panni del personaggio.
- Dimensione utile
- Sotto i 4B, la coerenza del personaggio nel tempo ne risente. Nel 2026, una base recente come Qwen 3.5 9B (~6,6 GB, 256k di contesto) o Gemma 4 12B (~7,6 GB, Apache 2.0) rappresenta il punto di equilibrio per la maggior parte delle schede grafiche di fascia media; un gradino più in alto, Mistral Small 24B (~14 GB, molto a suo agio in francese) sta in 16 GB e offre maggiore finezza narrativa.
- Fine-tunes RP
- Cerca modelli specificamente addestrati per il roleplay o la fiction (spesso indicati come « RP », « storytelling » o « uncensored » su Hugging Face). I migliori fine-tunes del 2026 sono costruiti su queste basi recenti (Qwen 3.5, Mistral Small 24B, Gemma 4) piuttosto che sui vecchi Llama 2 o Mistral 7B del 2023; seguono meglio il formato delle carte.
- Contesto lungo
- Preferisci un modello che regga bene contesti da 16k token o più senza degenerare: le sessioni di gioco lunghe lo richiedono. Verifica la dimensione dichiarata del contesto nativo del modello.
- Formato GGUF
- Per KoboldCpp, usa solo modelli GGUF quantizzati. Q4_K_M è il compromesso consigliato; passa a Q5_K_M o Q8_0 se la tua VRAM lo permette e cerchi maggiore finezza.
#Risoluzione dei problemi comuni
- SillyTavern non si connette
- Verifica che il backend sia in esecuzione e che la porta sia quella corretta (5001 per KoboldCpp, 11434 per Ollama). Un test nel browser sull'URL dell'API conferma che risponde.
- Risposte con tag visibili
- Quasi sempre un template di istruzioni inadatto. Allinea il formato (ChatML, Gemma, Mistral…) a quello del modello nella sezione Advanced Formatting.
- Il personaggio esce dal suo ruolo
- Rafforza la descrizione e gli esempi di dialogo, abbassa un po' la temperatura, e verifica che il tuo system prompt non entri in conflitto con la scheda.
- Ripetizioni e loop
- Aumenta leggermente la penalità di ripetizione e aggiungi un Min-P. Se il problema persiste, il contesto potrebbe essere saturo: attiva Summarize o riduci la dimensione della scheda.
- Risposte troncate
- Response length troppo basso, oppure il backend è stato avviato con un contesto più piccolo di quello richiesto da SillyTavern. Allinea i due valori.
#Per approfondire
SillyTavern è solo uno strato: la qualità finale dipende soprattutto dal tuo backend e dal modello. Queste guide ti aiutano a consolidare le fondamenta.
- KoboldCpp: installazione e primi passi
- Il backend di riferimento per il RP locale: GGUF, impostazioni di memoria e API supportate nativamente da SillyTavern.
- Ollama: cos'è e come funziona
- L'alternativa generalista se preferisci un daemon unico sulla porta 11434 per tutti i tuoi usi.
- Quantizzare la cache KV
- Per gestire contesti di RP più lunghi sulla stessa scheda grafica senza far esplodere il consumo di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.