Intermedio 10 minComunità

Qwythos 9B: il piccolo modello di ragionamento addestrato su Claude, testato in locale

Qwythos-9B è un modello della comunità pubblicato da Empero AI nel giugno 2026: una base Qwen3.5-9B con licenza Apache 2.0, contesto 1M, sottoposta a fine-tuning su tracce di ragionamento generate da Claude — da cui la parola macedonia « Qwythos » (Qwen + Mythos). Dietro non c'è una pagina di marketing patinata: solo pesi GGUF su Hugging Face e tag Ollama pubblicati dalla comunità. Questa guida fa chiarezza sulle sue origini, mostra come installarlo correttamente e lo confronta in un test reale con la sua base Qwen3.5-9B su una RTX 5070 Ti.

Di Mohamed Meguedmi·Agg. 2026-08-21·Testato su Windows, macOS e Linux

#Qwythos, che cos'è esattamente

Qwythos-9B non è un modello « da zero ». È un fine-tune: qualcuno ha preso una solida base aperta — Qwen3.5-9B di Alibaba — e l'ha riaddestrata su un corpus specifico di tracce di ragionamento. Queste tracce (catene di pensiero dettagliate, domanda → riflessione passo passo → risposta) proverrebbero dagli output di Claude, la famiglia di modelli di Anthropic, su un insieme di problemi di logica, matematica e programmazione. Il nome « Qwythos » racchiude l'idea: la lettera iniziale di Qwen e « Mythos », nome informale dato allo stile di ragionamento di Claude dalla comunità che ha assemblato il dataset.

L'interesse del progetto si riassume in una frase: distillare uno stile di ragionamento prolisso e strutturato in un modello abbastanza piccolo da girare su una GPU consumer. Un modello da 9B rientra in 6 GB di VRAM in Q4, mentre i grandi modelli di ragionamento richiedono decine di GB. Se il trasferimento del «modo di ragionare» funziona, si ottiene un ragionatore tascabile. È esattamente ciò che verificheremo.

i
Modello della community, non un prodotto ufficiale
Qwythos non è né un modello di Alibaba né un modello di Anthropic. È un fine-tune comunitario distribuito da Empero AI. Nessuna delle due aziende di origine lo mantiene o lo avalla. Trattalo come un progetto open source: i pesi sono disponibili, la qualità va verificata e il supporto dipende dalla buona volontà degli autori.

#Origine di Qwythos: le due fonti da conoscere

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Prima di installare qualcosa, bisogna capire da dove provengono realmente i pesi. Per un modello comunitario, la provenienza non è un dettaglio: condiziona la fiducia che puoi accordare al file che scarichi. Qwythos si trova in due posti, e i due non sono equivalenti.

Fonte 1 — Hugging Face (repository originale)
Empero AI pubblica i pesi su Hugging Face, sia nel formato transformers (safetensors) che in versione quantizzata GGUF. È la fonte di verità: scheda del modello, licenza Apache 2.0 visibile, menzione della base Qwen3.5-9B e del dataset di tracce di ragionamento. Parti sempre da qui per verificare l'hash e leggere la scheda.
Fonte 2 — Tag Ollama comunitari
Nel registro Ollama, Qwythos compare nei namespace degli utenti (del tipo nome-utente/qwythos), non nella libreria ufficiale. Questi tag sono pratici — basta un solo comando per installare — ma vengono riconfezionati da terzi a partire dai GGUF di Hugging Face. Verifica chi pubblica il tag prima di fidartene.
!
Un tag Ollama non è firmato
Chiunque può caricare un modello sul registro Ollama con il proprio nome. Un tag « qwythos » non garantisce che il file GGUF associato corrisponda ai pesi ufficiali di Empero AI. Per un uso serio, è preferibile scaricare il GGUF da Hugging Face e importarlo personalmente tramite un Modelfile (vedi più avanti), anziché scaricare alla cieca un modello con un tag della comunità.
Base
Qwen3.5-9B (Alibaba), licenza Apache 2.0
Tipo
Modello sottoposto a fine-tuning per il ragionamento, catena di pensiero esplicita
Sviluppatore
Empero AI (della comunità), pubblicazione a giugno 2026
Licenza
Apache 2.0 — uso commerciale autorizzato, licenza ereditata dal modello di base
Contesto
Contesto dichiarato di 1M di token (ereditato da Qwen3.5), da ridimensionare in base alla VRAM effettiva
Formati
safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) su Hugging Face

#Requisiti hardware

Un modello da 9 miliardi di parametri può essere eseguito agevolmente su hardware recente. Con la quantizzazione Q4_K_M — il compromesso qualità/memoria consigliato — Qwythos-9B occupa circa 6 GB di VRAM una volta caricato, ai quali si aggiunge la cache del contesto (KV cache), che cresce con la lunghezza dei prompt. Il nostro banco di prova utilizza una RTX 5070 Ti (16 GB), ben al di sopra del minimo.

Q4_K_M (raccomandato)
≈ 6 GB di VRAM. Entra nella memoria di una RTX 3060 da 12 GB, una 4070, una 5070 Ti — e persino in parte in 8 GB con un contesto contenuto.
Q5_K_M
≈ 7 GB. Leggero miglioramento di qualità, da preferire se hai 12 GB o più.
Q8_0
≈ 10 GB. Quasi senza perdita rispetto al FP16, adatto a configurazioni con 16 GB o più.
Contesto lungo
Il valore di 1M annunciato è teorico. Una cache KV per 128k token aggiunge già diversi GB; punta ad almeno 16 GB di VRAM per superare comodamente 32k.
→
Un modello di ragionamento genera molto
I modelli di ragionamento «pensano» ad alta voce prima di rispondere: a volte producono diverse centinaia di token di riflessione per una risposta di una sola riga. Prevedi un margine nel contesto di output (num_predict) e aspettati tempi di risposta più lunghi rispetto a un modello classico delle stesse dimensioni.

#Installare Qwythos con Ollama

Due strade. Quella rapida: scaricare un tag della community. Quella sicura: scaricare il GGUF ufficiale da Hugging Face e importarlo tramite un Modelfile. Le descrivo entrambe in dettaglio; per una postazione di lavoro destinata a un uso serio, la seconda è preferibile perché sai esattamente quale file stai eseguendo.

  1. 01
    Verificare che Ollama sia in esecuzione
    Ollama espone il suo daemon su http://localhost:11434. Una semplice chiamata conferma che risponde prima di procedere. Se non l'hai ancora installato, consulta la guida all'installazione di Ollama.
  2. 02
    Procedura rapida — tag della community
    Individua il tag su ollama.com (namespace utente), poi esegui ollama run. Annota il nome esatto di chi lo ha pubblicato: è la tua unica garanzia di provenienza.
  3. 03
    Percorso sicuro — GGUF da Hugging Face
    Scarica il file .gguf in Q4_K_M dal repository Empero AI, confronta la sua impronta SHA256 con quella riportata nella scheda del modello, poi crea un Modelfile che punti a quel file.
  4. 04
    Creare il modello locale
    Il comando ollama create crea un modello con un nome a partire dal tuo Modelfile. Ottieni un tag locale che controlli da capo a fondo.
  5. 05
    Avviare e conversare
    ollama run avvia la sessione interattiva. Al primo caricamento il modello viene caricato nella VRAM; gli avvii successivi sono istantanei finché vi rimane residente.
Terminale — verificare Ollama
curl http://localhost:11434/api/version
# {"version":"0.x.x"}
Terminale — metodo rapido (tag della community)
# Remplacez <publieur> par le nom réel du dépôt Ollama
ollama run <publieur>/qwythos:9b-q4_k_m
Terminale — procedura sicura (GGUF Hugging Face)
# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI
huggingface-cli download EmperoAI/Qwythos-9B-GGUF \
  qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos

# 2. Vérifier l'empreinte contre celle de la carte du modèle
sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf
Modelfile — qwythos.Modelfile
FROM ./qwythos/qwythos-9b-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 32768

# Encourage la chaîne de pensée explicite
SYSTEM """Tu es un assistant de raisonnement. Décompose chaque problème étape par étape avant de conclure."""
Terminale — importare e avviare
ollama create qwythos-9b -f qwythos.Modelfile
ollama run qwythos-9b
i
Temperatura più bassa per il ragionamento
Nei modelli di ragionamento, una temperatura intorno a 0.6 produce catene di pensiero più stabili rispetto al consueto valore di 0.8. Se la temperatura è troppo alta, il modello si perde in digressioni; se è troppo bassa (0.1-0.2), si ripete. La combinazione 0.6 / top_p 0.95 è un buon punto di partenza: regolala in base alle tue attività.

#Primo test di ragionamento

Cominciamo con un classico problema trabocchetto, di quelli che mettono in difficoltà i piccoli modelli non addestrati al ragionamento. L'obiettivo non è solo ottenere la risposta giusta, ma vedere se il modello sviluppa un ragionamento coerente anziché tirare a indovinare.

Prompt di test
ollama run qwythos-9b "Un batte et une balle coûtent 1,10 € au total. La batte coûte 1 € de plus que la balle. Combien coûte la balle ? Raisonne étape par étape."

Risposta attesa: 0,05 €. La trappola intuitiva spinge verso 0,10 €. Sul nostro banco di prova, Qwythos-9B imposta l'equazione (pallina = x, mazza = x + 1, totale 2x + 1 = 1,10), isola x = 0,05 e verifica che 0,05 + 1,05 = 1,10 prima di concludere. Il procedimento è prolisso — una decina di righe di riflessione per una risposta di un solo numero — ma è corretto e tracciabile. È precisamente il comportamento che ci si aspetta da un fine-tune di ragionamento.

→
Prova sui TUOI problemi
Un modello può aver visto questo tipo di enigma classico durante l'addestramento. Per valutarlo onestamente, costruisci due o tre problemi tratti dal tuo ambito reale (un vincolo logistico, un pezzo di codice di cui correggere i bug, un calcolo legato alla tua attività) e confronta il procedimento, non solo il risultato finale.

#Qwythos vs Qwen3.5-9B di base: cosa cambia con il fine-tuning

La vera domanda: il fine-tune aggiunge qualcosa rispetto al modello di base da cui deriva? Per misurarlo, si installa anche Qwen3.5-9B di base e si sottopone ai due modelli la stessa serie di problemi di logica e matematica, alla stessa temperatura. Ecco i risultati sul nostro banco di prova con RTX 5070 Ti.

Terminale — installare il modello di base per il confronto
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "Un batte et une balle coûtent 1,10 €..."
Lunghezza della riflessione
Qwythos sviluppa sempre una catena di pensiero esplicita; la base Qwen3.5 risponde spesso più brevemente, a volte direttamente, senza mostrare i passaggi intermedi.
Problemi con trabocchetti
Negli enigmi controintuitivi (mazza/palla, sequenze logiche), Qwythos sbaglia meno perché verifica la propria risposta. Il modello di base cade più facilmente nella trappola dell'intuizione.
Velocità
Il vantaggio va al modello di base: genera meno token per una risposta equivalente. Qwythos è più lento in pratica perché «pensa» prima di rispondere — il prezzo del ragionamento.
Conoscenze fattuali
Pareggio. Il fine-tuning del ragionamento non aggiunge conoscenze fattuali; sulle domande di cultura generale, i due modelli si equivalgono (e condividono le stesse lacune).
Francese
Equivalente. La qualità del francese deriva dalla base Qwen3.5; Qwythos non migliora né peggiora la fluidità, ma modifica la struttura della risposta, non la lingua.

Verdetto del confronto: Qwythos vince chiaramente nei compiti in cui conta il percorso di ragionamento (matematica, logica, debug, pianificazione) e perde in termini di velocità e risposte brevi. Se vuoi un assistente veloce per riformulazioni o riassunti, il modello di base Qwen3.5-9B basta. Se vuoi un piccolo modello di ragionamento che mostri i suoi passaggi, Qwythos giustifica la propria esistenza.

!
Il ragionamento non è gratuito
Catena di pensiero = più token generati = maggiore latenza e maggiore consumo di VRAM per il contesto. Nei compiti semplici, costringere un modello a ragionare lo rallenta senza apportare alcun vantaggio. Riserva Qwythos ai problemi che traggono davvero beneficio da una scomposizione e tieni un modello più diretto per il resto.

#Il fratello maggiore: Qwythos 27B

Empero AI pubblica anche una variante da 27B, basata su una versione più grande di Qwen3.5 secondo lo stesso principio: fine-tuning su tracce di ragionamento. È destinata a chi dispone della VRAM necessaria per migliorare ulteriormente la qualità del ragionamento, al prezzo di un fabbisogno di memoria nettamente superiore.

VRAM (Q4_K_M)
≈ 19 GB. Serve una RTX 4090 24 GB, una scheda professionale, oppure un Mac con memoria unificata (M4 Pro/Max) per ospitarlo comodamente.
Ciò che si guadagna
Catene di ragionamento più lunghe e più robuste sui problemi a più passaggi; meno errori aritmetici in cascata. La differenza si accentua soprattutto sulle attività veramente difficili.
Ciò che si paga
Il triplo della VRAM e una generazione più lenta. Su hardware da 12–16 GB, il modello 27B in Q4 semplicemente non entra in memoria senza offload sulla CPU, che rallenta drasticamente la generazione.
Quando sceglierlo
Se il 9B fallisce regolarmente sui tuoi problemi reali E hai 24 GB di VRAM. Altrimenti, il 9B resta la scelta con il miglior rapporto qualità/risorse.
i
Inizia con il 9B
Non scegliere il 27B per riflesso. Prova prima il 9B sulle tue attività reali: in molti casi basta. Passa al 27B solo se individui un limite concreto di qualità su problemi che devi davvero risolvere, non per principio.

#Risoluzione dei problemi

Il tag Ollama non esiste / è scomparso
I tag della comunità vanno e vengono. Scegli la strada sicura: scarica il GGUF da Hugging Face e importalo tramite Modelfile. Non dipendi più dalla disponibilità di un soggetto terzo.
Il modello non ragiona, dà risposte secche
Aggiungi una istruzione di sistema esplicita (« scomponi passo per passo ») e verifica che num_ctx sia abbastanza grande per lasciare spazio alla riflessione. Una temperatura troppo bassa comprime anche la catena di pensiero.
Risposte troncate
Il ragionamento consuma il budget di output. Aumenta num_predict (o il parametro equivalente del tuo client) per lasciare che il modello completi il ragionamento E fornisca la risposta.
Risposta molto lenta
Verifica che il modello rientri interamente nella VRAM (ollama ps). Se una parte viene caricata nella RAM di sistema, la velocità crolla: passa a una quantizzazione di un livello inferiore oppure riduci num_ctx.
Dubbio sull'integrità del file
Confronta lo SHA256 del GGUF scaricato con quello pubblicato sulla scheda Hugging Face. Un'impronta diversa indica un file riconfezionato o corrotto — non eseguirlo.

#Per approfondire

Per installare i moduli attorno a Qwythos e capire i compromessi menzionati qui:

Installare Ollama (Windows, macOS, Linux)
Il prerequisito di questa guida: configurare il daemon Ollama sulla porta 11434 prima di scaricare qualsiasi modello.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per scegliere tra Q4_K_M, Q5_K_M e Q8_0 in base alla tua VRAM e alle esigenze di qualità, sia per Qwythos sia per i modelli della stessa famiglia.
Installare DeepSeek R1 con Ollama
Un altro modello di ragionamento open source con catena di pensiero, utile per confrontare l'approccio di Qwythos con un riferimento consolidato.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.