Qwythos 9B: il piccolo modello di ragionamento addestrato su Claude, testato in locale
Qwythos-9B è un modello della comunità pubblicato da Empero AI nel giugno 2026: una base Qwen3.5-9B con licenza Apache 2.0, contesto 1M, sottoposta a fine-tuning su tracce di ragionamento generate da Claude — da cui la parola macedonia « Qwythos » (Qwen + Mythos). Dietro non c'è una pagina di marketing patinata: solo pesi GGUF su Hugging Face e tag Ollama pubblicati dalla comunità. Questa guida fa chiarezza sulle sue origini, mostra come installarlo correttamente e lo confronta in un test reale con la sua base Qwen3.5-9B su una RTX 5070 Ti.
#Qwythos, che cos'è esattamente
Qwythos-9B non è un modello « da zero ». È un fine-tune: qualcuno ha preso una solida base aperta — Qwen3.5-9B di Alibaba — e l'ha riaddestrata su un corpus specifico di tracce di ragionamento. Queste tracce (catene di pensiero dettagliate, domanda → riflessione passo passo → risposta) proverrebbero dagli output di Claude, la famiglia di modelli di Anthropic, su un insieme di problemi di logica, matematica e programmazione. Il nome « Qwythos » racchiude l'idea: la lettera iniziale di Qwen e « Mythos », nome informale dato allo stile di ragionamento di Claude dalla comunità che ha assemblato il dataset.
L'interesse del progetto si riassume in una frase: distillare uno stile di ragionamento prolisso e strutturato in un modello abbastanza piccolo da girare su una GPU consumer. Un modello da 9B rientra in 6 GB di VRAM in Q4, mentre i grandi modelli di ragionamento richiedono decine di GB. Se il trasferimento del «modo di ragionare» funziona, si ottiene un ragionatore tascabile. È esattamente ciò che verificheremo.
#Origine di Qwythos: le due fonti da conoscere
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Prima di installare qualcosa, bisogna capire da dove provengono realmente i pesi. Per un modello comunitario, la provenienza non è un dettaglio: condiziona la fiducia che puoi accordare al file che scarichi. Qwythos si trova in due posti, e i due non sono equivalenti.
- Fonte 1 — Hugging Face (repository originale)
- Empero AI pubblica i pesi su Hugging Face, sia nel formato transformers (safetensors) che in versione quantizzata GGUF. È la fonte di verità: scheda del modello, licenza Apache 2.0 visibile, menzione della base Qwen3.5-9B e del dataset di tracce di ragionamento. Parti sempre da qui per verificare l'hash e leggere la scheda.
- Fonte 2 — Tag Ollama comunitari
- Nel registro Ollama, Qwythos compare nei namespace degli utenti (del tipo nome-utente/qwythos), non nella libreria ufficiale. Questi tag sono pratici — basta un solo comando per installare — ma vengono riconfezionati da terzi a partire dai GGUF di Hugging Face. Verifica chi pubblica il tag prima di fidartene.
- Base
- Qwen3.5-9B (Alibaba), licenza Apache 2.0
- Tipo
- Modello sottoposto a fine-tuning per il ragionamento, catena di pensiero esplicita
- Sviluppatore
- Empero AI (della comunità), pubblicazione a giugno 2026
- Licenza
- Apache 2.0 — uso commerciale autorizzato, licenza ereditata dal modello di base
- Contesto
- Contesto dichiarato di 1M di token (ereditato da Qwen3.5), da ridimensionare in base alla VRAM effettiva
- Formati
- safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) su Hugging Face
#Requisiti hardware
Un modello da 9 miliardi di parametri può essere eseguito agevolmente su hardware recente. Con la quantizzazione Q4_K_M — il compromesso qualità/memoria consigliato — Qwythos-9B occupa circa 6 GB di VRAM una volta caricato, ai quali si aggiunge la cache del contesto (KV cache), che cresce con la lunghezza dei prompt. Il nostro banco di prova utilizza una RTX 5070 Ti (16 GB), ben al di sopra del minimo.
- Q4_K_M (raccomandato)
- ≈ 6 GB di VRAM. Entra nella memoria di una RTX 3060 da 12 GB, una 4070, una 5070 Ti — e persino in parte in 8 GB con un contesto contenuto.
- Q5_K_M
- ≈ 7 GB. Leggero miglioramento di qualità, da preferire se hai 12 GB o più.
- Q8_0
- ≈ 10 GB. Quasi senza perdita rispetto al FP16, adatto a configurazioni con 16 GB o più.
- Contesto lungo
- Il valore di 1M annunciato è teorico. Una cache KV per 128k token aggiunge già diversi GB; punta ad almeno 16 GB di VRAM per superare comodamente 32k.
#Installare Qwythos con Ollama
Due strade. Quella rapida: scaricare un tag della community. Quella sicura: scaricare il GGUF ufficiale da Hugging Face e importarlo tramite un Modelfile. Le descrivo entrambe in dettaglio; per una postazione di lavoro destinata a un uso serio, la seconda è preferibile perché sai esattamente quale file stai eseguendo.
- 01Verificare che Ollama sia in esecuzioneOllama espone il suo daemon su http://localhost:11434. Una semplice chiamata conferma che risponde prima di procedere. Se non l'hai ancora installato, consulta la guida all'installazione di Ollama.
- 02Procedura rapida — tag della communityIndividua il tag su ollama.com (namespace utente), poi esegui ollama run. Annota il nome esatto di chi lo ha pubblicato: è la tua unica garanzia di provenienza.
- 03Percorso sicuro — GGUF da Hugging FaceScarica il file .gguf in Q4_K_M dal repository Empero AI, confronta la sua impronta SHA256 con quella riportata nella scheda del modello, poi crea un Modelfile che punti a quel file.
- 04Creare il modello localeIl comando ollama create crea un modello con un nome a partire dal tuo Modelfile. Ottieni un tag locale che controlli da capo a fondo.
- 05Avviare e conversareollama run avvia la sessione interattiva. Al primo caricamento il modello viene caricato nella VRAM; gli avvii successivi sono istantanei finché vi rimane residente.
#Primo test di ragionamento
Cominciamo con un classico problema trabocchetto, di quelli che mettono in difficoltà i piccoli modelli non addestrati al ragionamento. L'obiettivo non è solo ottenere la risposta giusta, ma vedere se il modello sviluppa un ragionamento coerente anziché tirare a indovinare.
Risposta attesa: 0,05 €. La trappola intuitiva spinge verso 0,10 €. Sul nostro banco di prova, Qwythos-9B imposta l'equazione (pallina = x, mazza = x + 1, totale 2x + 1 = 1,10), isola x = 0,05 e verifica che 0,05 + 1,05 = 1,10 prima di concludere. Il procedimento è prolisso — una decina di righe di riflessione per una risposta di un solo numero — ma è corretto e tracciabile. È precisamente il comportamento che ci si aspetta da un fine-tune di ragionamento.
#Qwythos vs Qwen3.5-9B di base: cosa cambia con il fine-tuning
La vera domanda: il fine-tune aggiunge qualcosa rispetto al modello di base da cui deriva? Per misurarlo, si installa anche Qwen3.5-9B di base e si sottopone ai due modelli la stessa serie di problemi di logica e matematica, alla stessa temperatura. Ecco i risultati sul nostro banco di prova con RTX 5070 Ti.
- Lunghezza della riflessione
- Qwythos sviluppa sempre una catena di pensiero esplicita; la base Qwen3.5 risponde spesso più brevemente, a volte direttamente, senza mostrare i passaggi intermedi.
- Problemi con trabocchetti
- Negli enigmi controintuitivi (mazza/palla, sequenze logiche), Qwythos sbaglia meno perché verifica la propria risposta. Il modello di base cade più facilmente nella trappola dell'intuizione.
- Velocità
- Il vantaggio va al modello di base: genera meno token per una risposta equivalente. Qwythos è più lento in pratica perché «pensa» prima di rispondere — il prezzo del ragionamento.
- Conoscenze fattuali
- Pareggio. Il fine-tuning del ragionamento non aggiunge conoscenze fattuali; sulle domande di cultura generale, i due modelli si equivalgono (e condividono le stesse lacune).
- Francese
- Equivalente. La qualità del francese deriva dalla base Qwen3.5; Qwythos non migliora né peggiora la fluidità, ma modifica la struttura della risposta, non la lingua.
Verdetto del confronto: Qwythos vince chiaramente nei compiti in cui conta il percorso di ragionamento (matematica, logica, debug, pianificazione) e perde in termini di velocità e risposte brevi. Se vuoi un assistente veloce per riformulazioni o riassunti, il modello di base Qwen3.5-9B basta. Se vuoi un piccolo modello di ragionamento che mostri i suoi passaggi, Qwythos giustifica la propria esistenza.
#Il fratello maggiore: Qwythos 27B
Empero AI pubblica anche una variante da 27B, basata su una versione più grande di Qwen3.5 secondo lo stesso principio: fine-tuning su tracce di ragionamento. È destinata a chi dispone della VRAM necessaria per migliorare ulteriormente la qualità del ragionamento, al prezzo di un fabbisogno di memoria nettamente superiore.
- VRAM (Q4_K_M)
- ≈ 19 GB. Serve una RTX 4090 24 GB, una scheda professionale, oppure un Mac con memoria unificata (M4 Pro/Max) per ospitarlo comodamente.
- Ciò che si guadagna
- Catene di ragionamento più lunghe e più robuste sui problemi a più passaggi; meno errori aritmetici in cascata. La differenza si accentua soprattutto sulle attività veramente difficili.
- Ciò che si paga
- Il triplo della VRAM e una generazione più lenta. Su hardware da 12–16 GB, il modello 27B in Q4 semplicemente non entra in memoria senza offload sulla CPU, che rallenta drasticamente la generazione.
- Quando sceglierlo
- Se il 9B fallisce regolarmente sui tuoi problemi reali E hai 24 GB di VRAM. Altrimenti, il 9B resta la scelta con il miglior rapporto qualità/risorse.
#Risoluzione dei problemi
- Il tag Ollama non esiste / è scomparso
- I tag della comunità vanno e vengono. Scegli la strada sicura: scarica il GGUF da Hugging Face e importalo tramite Modelfile. Non dipendi più dalla disponibilità di un soggetto terzo.
- Il modello non ragiona, dà risposte secche
- Aggiungi una istruzione di sistema esplicita (« scomponi passo per passo ») e verifica che num_ctx sia abbastanza grande per lasciare spazio alla riflessione. Una temperatura troppo bassa comprime anche la catena di pensiero.
- Risposte troncate
- Il ragionamento consuma il budget di output. Aumenta num_predict (o il parametro equivalente del tuo client) per lasciare che il modello completi il ragionamento E fornisca la risposta.
- Risposta molto lenta
- Verifica che il modello rientri interamente nella VRAM (ollama ps). Se una parte viene caricata nella RAM di sistema, la velocità crolla: passa a una quantizzazione di un livello inferiore oppure riduci num_ctx.
- Dubbio sull'integrità del file
- Confronta lo SHA256 del GGUF scaricato con quello pubblicato sulla scheda Hugging Face. Un'impronta diversa indica un file riconfezionato o corrotto — non eseguirlo.
#Per approfondire
Per installare i moduli attorno a Qwythos e capire i compromessi menzionati qui:
- Installare Ollama (Windows, macOS, Linux)
- Il prerequisito di questa guida: configurare il daemon Ollama sulla porta 11434 prima di scaricare qualsiasi modello.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per scegliere tra Q4_K_M, Q5_K_M e Q8_0 in base alla tua VRAM e alle esigenze di qualità, sia per Qwythos sia per i modelli della stessa famiglia.
- Installare DeepSeek R1 con Ollama
- Un altro modello di ragionamento open source con catena di pensiero, utile per confrontare l'approccio di Qwythos con un riferimento consolidato.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.