Intermedio 12 minInterfacce

SillyTavern: l'interfaccia per personaggi per i modelli LLM locale

SillyTavern è un'interfaccia web pensata per il gioco di ruolo e la scrittura interattiva con un LLM. Non esegue direttamente alcun modello: si collega a un backend locale come KoboldCpp o Ollama e aggiunge tutto ciò che manca alla chat classica — schede dei personaggi, memoria persistente del mondo, controllo dettagliato del prompt ed estensioni. Questa guida copre l'installazione, la connessione al tuo backend, la creazione dei personaggi e le impostazioni che fanno la differenza nell'interpretazione dei personaggi.

Di Léa B.·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché SillyTavern piuttosto che una chat classica

Un'interfaccia come Open WebUI o LM Studio tratta ogni conversazione come un'interazione tra assistente e utente. SillyTavern parte da un altro bisogno: incarnare un personaggio coerente per centinaia di messaggi, in un universo che ricorda le proprie regole. È lo strumento di riferimento della comunità dei giochi di ruolo con LLM locale e offre meccaniche che una semplice chat non ha.

Schede dei personaggi
Un formato standardizzato (PNG con metadati incorporati) che descrive persona, stile, esempi di dialogo e messaggio di benvenuto. Importabile e condivisibile in un file.
Memoria del mondo
Il lorebook inserisce informazioni nel prompt solo quando appare una parola chiave, mantenendo così un universo coerente senza saturare il contesto.
Controllo del prompt
Vedi e modifichi ogni componente inviato al modello: prompt di sistema, formato delle istruzioni, ordine di inserimento. Nulla è nascosto.
Backend a scelta
SillyTavern è un front-end puro. Lo stesso personaggio gira su KoboldCpp, Ollama, llama.cpp o su un'API remota senza dover riscrivere nulla.
i
SillyTavern non sostituisce il tuo server di inferenza
È uno strato di interfaccia. Ti serve comunque un backend che carichi il modello ed esegua la generazione. SillyTavern si limita a orchestrare il prompt e a mostrare il risultato.

#Prerequisiti e scelta del backend

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

SillyTavern funziona su Node.js (versione 18 o successiva) su Windows, macOS e Linux. Richiede poche risorse — è il backend a consumare la VRAM. Due backend locali coprono quasi tutti gli usi: KoboldCpp, orientato a GGUF e al gioco di ruolo, e Ollama, più generalista.

KoboldCpp
Un unico binario che esegue modelli GGUF con un'API supportata nativamente da SillyTavern. Impostazioni dettagliate per la memoria, supporto per AMD ROCm. La scelta predefinita della comunità RP.
Ollama
Il daemon ascolta su http://localhost:11434. È comodo se lo usi già per altro; SillyTavern vi si collega tramite il suo endpoint compatibile.
llama.cpp (llama-server)
Server HTTP compatibile con OpenAI per un controllo massimo sull'offloading dei layer.
VRAM
In Q4_K_M: un 7B entra in circa 5 GB, un 14B in circa 9 GB, un 32B in circa 19 GB. Per un RP fluido, punta almeno a un 12-14B se la tua scheda lo permette.
→
Contesto lungo = più VRAM
Il gioco di ruolo si sviluppa su contesti lunghi (8k, 16k, 32k token). La cache KV cresce con il contesto e consuma VRAM oltre a quella occupata dai pesi. Prevedi un margine oppure quantizza la cache KV per far entrare un contesto più ampio nella stessa scheda.

#Installare SillyTavern

Il metodo consigliato è la clonazione con Git: rende gli aggiornamenti semplicissimi (basta un git pull) e SillyTavern evolve rapidamente. Assicurati di avere Node.js 18+ e Git installati.

  1. 01
    Clonare il repository
    Scarica il ramo release, stabile e testato. Evita il ramo staging, a meno che tu non voglia le novità in anteprima al prezzo di qualche bug.
  2. 02
    Avviare lo script di avvio
    start.sh sotto Linux/macOS, Start.bat sotto Windows. Al primo avvio, npm installa automaticamente le dipendenze.
  3. 03
    Aprire l'interfaccia
    SillyTavern rende disponibile la sua interfaccia su http://localhost:8000. Apri questo indirizzo nel tuo browser; non c'è alcuna applicazione desktop da installare.
  4. 04
    Aggiornare più tardi
    Un git pull nella cartella, poi riavvia lo script. I tuoi personaggi e le tue conversazioni sono salvati separatamente in data/ e non vengono sovrascritti.
Terminal (Linux/macOS)
# Cloner la branche stable
git clone https://github.com/SillyTavern/SillyTavern -b release
cd SillyTavern

# Premier lancement : installe les dépendances puis démarre
./start.sh

# Interface accessible sur http://localhost:8000
PowerShell (Windows)
git clone https://github.com/SillyTavern/SillyTavern -b release
cd SillyTavern

# Double-cliquez Start.bat, ou en ligne de commande :
.\Start.bat
i
Accesso alla rete e sicurezza
Per impostazione predefinita SillyTavern ascolta solo su localhost. Se vuoi accedervi da un altro dispositivo della rete, attiva listen in config.yaml e configura un'autenticazione (basic auth). Non esporre mai l'interfaccia direttamente su Internet senza protezione.

#Collegare il backend locale

Una volta aperto SillyTavern, tutto si svolge nella scheda di connessione API (l'icona a forma di spina in alto). Il principio: avviare il backend da un lato, indicarne l'indirizzo a SillyTavern dall'altro.

#Con KoboldCpp

Avvia KoboldCpp con il tuo modello GGUF; espone la sua API sulla porta 5001 per impostazione predefinita. In SillyTavern, scegli il tipo di API «Text Completion», poi il backend «KoboldCpp» e inserisci l'URL. Clicca su Connect: se tutto è corretto, compare il nome del modello caricato.

Terminale
# Lancer KoboldCpp avec un modèle et 8k de contexte
./koboldcpp --model mon-modele-rp.Q4_K_M.gguf --contextsize 8192

# API disponible sur http://localhost:5001
# Dans SillyTavern : API = Text Completion > KoboldCpp
# URL = http://localhost:5001

#Con Ollama

Ollama è già in esecuzione come daemon sulla porta 11434. In SillyTavern, seleziona «Text Completion», poi il backend «Ollama», inserisci l'indirizzo e scegli il modello dall'elenco a discesa recuperato automaticamente.

Terminale
# Vérifier qu'Ollama tourne et lister les modèles
ollama list

# Le daemon écoute sur http://localhost:11434
# Dans SillyTavern : API = Text Completion > Ollama
# URL = http://localhost:11434
!
Il template di istruzioni corretto è decisivo
Ogni famiglia di modelli richiede un formato preciso (ChatML per Qwen 3.5/3.8 e gpt-oss, Gemma per Gemma 4, Mistral per Mistral Small…). Se le risposte sono incoerenti, troncate o piene di tag visibili, è quasi sempre colpa di un template scelto male. Impostalo nella scheda Advanced Formatting in modo che corrisponda al modello caricato.

#Creare e importare le carte dei personaggi

La scheda del personaggio è il cuore di SillyTavern. È un file PNG la cui immagine funge da avatar e i cui metadati incorporati descrivono il personaggio. Puoi crearne una da zero o importare una scheda condivisa dalla comunità.

#I campi che contano

Descrizione
La base del personaggio: aspetto, tratti, storia. Viene inserita costantemente nel contesto, quindi scrivi in modo conciso e concreto, senza dilungarti.
Personality
Un riassunto del temperamento. Utile per orientare il tono senza riscrivere tutta la descrizione.
First message
Il messaggio di benvenuto che introduce la scena. Definisce il tono, lo stile di scrittura e il formato attesi: il modello tende a imitarne la forma.
Example dialogues
Esempi di battute che mostrano al modello come parla il personaggio. Molto efficace per mantenere una voce particolare.
Scenario
Il contesto della scena, separato dalla descrizione del personaggio. Pratico per riutilizzare lo stesso personaggio in diverse situazioni.
  1. 01
    Aprire il pannello dei personaggi
    L'icona del personaggio nella barra superiore apre l'elenco. Il pulsante «+» crea una scheda vuota.
  2. 02
    Compilare la descrizione
    Descrivi il personaggio in modo dettagliato. Molti autori usano un formato strutturato (elenco di caratteristiche) piuttosto che un paragrafo, cosa che i modelli seguono bene.
  3. 03
    Scrivere il primo messaggio
    Curalo: è il tuo strumento migliore per orientare lo stile. Un messaggio di benvenuto narrativo in terza persona spinge il modello verso questo formato.
  4. 04
    Importare una scheda esistente
    Trascina un PNG di una scheda personaggio nell'elenco, oppure importalo. Le schede vengono condivise come semplici file immagine sugli hub della community.
→
Il budget dei token del personaggio
Tutto ciò che contiene la scheda occupa spazio nel contesto a ogni messaggio. Una descrizione di 2000 token su un contesto di 8k consuma un quarto del budget prima ancora di includere la cronologia. Sii conciso: la qualità conta più della lunghezza.

#Mondo persistente: il lorebook

Il lorebook (o World Info) risolve il problema centrale delle partite lunghe: come mantenere un universo coerente senza iniettare tutto in continuazione. Il principio è l'iniezione condizionata per parole chiave.

Crei delle voci, ciascuna associata a una o più parole chiave. Quando una di queste parole appare nei messaggi recenti, la voce corrispondente viene inserita nel contesto subito prima della generazione. Per il resto del tempo non occupa spazio. In questo modo puoi descrivere decine di luoghi, personaggi secondari e regole senza mai saturare il prompt.

Input
Un blocco di testo (il lore da iniettare) e le parole chiave che lo attivano. Esempio: parola chiave «Valmont» → descrizione della città di Valmont.
Costante vs selettivo
Una voce può essere sempre attiva (regole fondamentali dell'universo) oppure attivata solo da una parola chiave (dettagli contestuali).
Profondità di inserimento
Scegli in quale posizione la voce viene inserita nel prompt, il che influisce sul peso che il modello le attribuisce.
Relativo al personaggio o globale
Un lorebook può accompagnare una scheda specifica o applicarsi a tutte le tue conversazioni come universo condiviso.
i
Lorebook ≠ RAG
L'iniezione per parole chiave è più semplice e più prevedibile di una ricerca vettoriale: si attiva su una corrispondenza di testo, non su una similarità semantica. Per un universo narrativo strutturato, è spesso più affidabile di un RAG classico e rimane del tutto sotto il tuo controllo.

#Regolare la generazione per l'interpretazione

I parametri di sampling determinano l'equilibrio tra coerenza e creatività. Per il gioco di ruolo si cerca più varietà che per l'assistenza fattuale, senza cadere nell'incoerenza. Queste impostazioni si trovano nella scheda dei parametri di generazione (l'icona con i cursori).

Temperatura
Il cursore creatività/stabilità. Intorno a 0,7-0,9 per un buon equilibrio nel gioco di ruolo. Un valore troppo alto (> 1,2) porta a incoerenze; uno troppo basso rende il personaggio ripetitivo e piatto.
Min-P
Un sampler moderno che esclude i token improbabili in proporzione al token più probabile. Un valore di 0.05-0.1 ripulisce l'output e permette di aumentare la temperatura senza andare fuori strada.
Penalità di ripetizione
Penalizza la ripetizione degli stessi token. Utile contro i loop, ma un valore troppo alto costringe il modello a usare formulazioni artificiali. Mantieni un valore moderato.
Response length
Il numero massimo di token generati per risposta. 200-400 token per battute narrative sostanziose senza monologhi interminabili.
Context size
Deve corrispondere a ciò che il tuo backend ha caricato. Non serve chiedere 16k a SillyTavern se KoboldCpp è stato avviato soltanto con 8k.
→
Partire da un preset prima di modificarlo
SillyTavern fornisce preset di sampling pronti all'uso. Caricane uno adatto al gioco di ruolo, interpreta una scena, poi regola un parametro alla volta. Cambiare cinque cursori contemporaneamente rende impossibile qualsiasi diagnosi.

#Le estensioni che modificano l'esperienza

SillyTavern è estendibile. Alcune estensioni sono incluse di default, altre vengono installate tramite l'URL del repository. Ecco quelle che trasformano veramente l'uso.

Vector Storage (riepilogo della memoria)
Vettorizza la cronologia e reinserisce i passaggi pertinenti dei vecchi messaggi, estendendo la memoria oltre la finestra di contesto. Utile per le partite molto lunghe.
Summarize
Genera e mantiene un riassunto aggiornato della conversazione, reinserito nel prompt. Il personaggio ricorda gli eventi principali anche dopo centinaia di messaggi.
Text-to-Speech
Dà una voce ai personaggi tramite un motore TTS locale. Maggiore immersione per chi gioca a voce.
Generazione di immagini
Si collega a un backend locale per le immagini (come Stable Diffusion) per illustrare scene e personaggi al volo dalla chat.
Espressioni
Mostra l'avatar con un'emozione che corrisponde al tono del messaggio, a partire da un set di sprite del personaggio.
i
Ogni estensione costa token o VRAM
Summarize e Vector Storage consumano contesto; la generazione di immagini e il TTS richiedono modelli propri e quindi VRAM o risorse CPU aggiuntive rispetto al tuo LLM. Attivali in base alle tue risorse hardware, non tutti insieme.

#Quali modelli locali eccellono nell'interpretazione

Non tutti i LLM si equivalgono nel gioco di ruolo. I modelli «instruct» allineati per l'assistenza tendono a uscire dal personaggio, a fare la morale o a rifiutare scenari di finzione. La comunità privilegia modelli con fine-tuning specializzato, spesso costruiti su basi solide e poi riaddestrati per la narrazione e il dialogo nei panni del personaggio.

Dimensione utile
Sotto i 4B, la coerenza del personaggio nel tempo ne risente. Nel 2026, una base recente come Qwen 3.5 9B (~6,6 GB, 256k di contesto) o Gemma 4 12B (~7,6 GB, Apache 2.0) rappresenta il punto di equilibrio per la maggior parte delle schede grafiche di fascia media; un gradino più in alto, Mistral Small 24B (~14 GB, molto a suo agio in francese) sta in 16 GB e offre maggiore finezza narrativa.
Fine-tunes RP
Cerca modelli specificamente addestrati per il roleplay o la fiction (spesso indicati come « RP », « storytelling » o « uncensored » su Hugging Face). I migliori fine-tunes del 2026 sono costruiti su queste basi recenti (Qwen 3.5, Mistral Small 24B, Gemma 4) piuttosto che sui vecchi Llama 2 o Mistral 7B del 2023; seguono meglio il formato delle carte.
Contesto lungo
Preferisci un modello che regga bene contesti da 16k token o più senza degenerare: le sessioni di gioco lunghe lo richiedono. Verifica la dimensione dichiarata del contesto nativo del modello.
Formato GGUF
Per KoboldCpp, usa solo modelli GGUF quantizzati. Q4_K_M è il compromesso consigliato; passa a Q5_K_M o Q8_0 se la tua VRAM lo permette e cerchi maggiore finezza.
→
Testare una scheda su due o tre modelli
Lo stesso personaggio può sembrare poco interessante con un modello e brillante con un altro. Prima di concludere che la tua scheda sia scadente, provala con alcuni modelli RP diversi: la differenza nei risultati è spesso spettacolare.

#Risoluzione dei problemi comuni

SillyTavern non si connette
Verifica che il backend sia in esecuzione e che la porta sia quella corretta (5001 per KoboldCpp, 11434 per Ollama). Un test nel browser sull'URL dell'API conferma che risponde.
Risposte con tag visibili
Quasi sempre un template di istruzioni inadatto. Allinea il formato (ChatML, Gemma, Mistral…) a quello del modello nella sezione Advanced Formatting.
Il personaggio esce dal suo ruolo
Rafforza la descrizione e gli esempi di dialogo, abbassa un po' la temperatura, e verifica che il tuo system prompt non entri in conflitto con la scheda.
Ripetizioni e loop
Aumenta leggermente la penalità di ripetizione e aggiungi un Min-P. Se il problema persiste, il contesto potrebbe essere saturo: attiva Summarize o riduci la dimensione della scheda.
Risposte troncate
Response length troppo basso, oppure il backend è stato avviato con un contesto più piccolo di quello richiesto da SillyTavern. Allinea i due valori.

#Per approfondire

SillyTavern è solo uno strato: la qualità finale dipende soprattutto dal tuo backend e dal modello. Queste guide ti aiutano a consolidare le fondamenta.

KoboldCpp: installazione e primi passi
Il backend di riferimento per il RP locale: GGUF, impostazioni di memoria e API supportate nativamente da SillyTavern.
Ollama: cos'è e come funziona
L'alternativa generalista se preferisci un daemon unico sulla porta 11434 per tutti i tuoi usi.
Quantizzare la cache KV
Per gestire contesti di RP più lunghi sulla stessa scheda grafica senza far esplodere il consumo di VRAM.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.