Magistral Small 24B vs Qwen 3 32B: mini-Mistral 2026
Le Magistral Small 24B è il modello di ragionamento compatto di Mistral AI, progettato per funzionare in locale su una singola GPU consumer. A confronto, il Qwen 3 32B di Alibaba si è affermato come uno dei punti di riferimento open-weights nella categoria dei modelli densi di medie dimensioni dal suo lancio nel 2025. Questo articolo confronta i due in dettaglio: specifiche della VRAM per livello di quantizzazione, velocità di inferenza su hardware reale, licenze, risultati nei benchmark pubblici e scenari d'uso concreti. Che tu stia assemblando una workstation orientata al ragionamento o cercando un modello versatile per l'elaborazione di testi lunghi, questa pagina ti fornisce gli elementi necessari per scegliere.
Presentazione dei due modelli
Magistral Small 24B
Magistral Small 24B appartiene alla famiglia Magistral di Mistral AI, accanto a una variante più grande (Magistral Medium, ~123 miliardi di parametri). La sua caratteristica principale è l'orientamento ragionamento strutturato : il modello genera una catena di pensiero intermedia (chain-of-thought) prima di produrre la risposta finale, il che lo distingue dai modelli Mistral delle generazioni precedenti. Con 24 miliardi di parametri, si colloca nella categoria dei LLM eseguibili su una GPU da 24 GB con quantizzazione Q4.
La scheda tecnica ufficiale è disponibile su HuggingFace — mistralai/Magistral-Small-2506 e nell'annuncio di Mistral AI.
Qwen 3 32B
Il Qwen 3 32B è un modello dense (non-MoE) prodotto da Alibaba Research, derivato dalla terza generazione della famiglia Qwen. La sua architettura densa lo rende più prevedibile in termini di consumo VRAM rispetto alle varianti MoE della stessa famiglia, come il Qwen 3 235B-A22B che attiva soltanto 22 miliardi di parametri durante l'inferenza nonostante i 235 miliardi totali. Qwen 3 32B copre un ampio spettro: programmazione, ragionamento matematico, elaborazione multilingue, contesto lungo.
Documentazione ufficiale su HuggingFace — Qwen/Qwen3-32B e sul blog Qwen.
Specifiche tecniche e VRAM
Per le stime di VRAM, la regola empirica è: parametri × da 0,5 a 0,55 GB in Q4, × 1 GB in Q8, × 2 GB in FP16. I valori qui sotto sono stime ricavate da questo metodo e dai riscontri della comunità — verificali in base al tuo backend (llama.cpp, llamafile, LM Studio).
Magistral Small 24B
- Parametri : 24 miliardi
- Architettura : denso, decodificatore Transformer (dettagli architetturali da confermare)
- Q4_K_M : circa 13 GB VRAM
- Q5_K_M : ~16 GB VRAM (stimato)
- Q8_0 : ~24 GB VRAM
- FP16 : ~48 GB VRAM
- Contesto : da confermare in base alla variante pubblicata; i modelli Mistral recenti puntano a un contesto da 32 768 a 128 000 token
In Q4_K_M, il modello rientra comodamente nella memoria di una RTX 4090 (24 GB), con margine per la cache KV su contesti brevi. In Q8, la scheda raggiunge il limite; una RTX 6000 Ada (48 GB) o una A5000 è preferibile per sessioni lunghe.
Qwen 3 32B
- Parametri : 32 miliardi
- Architettura : densa, decoder transformer
- Q4_K_M : ~18 GB VRAM
- Q5_K_M : ~22 GB VRAM (stimato)
- Q8_0 : ~32 GB VRAM
- FP16 : ~64 GB VRAM
- Contesto : 128 000 token
Qwen 3 32B entra in memoria in Q4 su una RTX 4090, ma con un contesto lungo (64 K token o più), la cache KV porta il totale oltre i 24 GB disponibili. Per un utilizzo agevole con un contesto esteso, si consiglia una scheda da 48 GB (RTX 6000 Ada, A40).
Per approfondire i calcoli della VRAM in base alla quantizzazione, consulta il guida VRAM di QualeLLM.
Velocità di inferenza
I numeri seguenti sono stime basate sui feedback della comunità su llama.cpp e LM Studio. Variano in base all'hardware, alla lunghezza del prompt, al backend e alla quantizzazione esatta utilizzata.
Su RTX 4090 (24 GB, Q4_K_M)
Magistral Small 24B - Generazione : ~25–40 token/sec (stimato, prompt breve) - Prefill : ~1 500–2 500 token/sec (stimato)
Qwen 3 32B - Generazione : ~18–28 token/sec (stimato, prompt breve) - Prefill : ~1.000–1.800 token/sec (stimato)
Il modello più leggero (24B) genera sensibilmente più velocemente sulla stessa GPU — con circa il 30-50% di token al secondo in più in Q4 (stima). La differenza si riduce su GPU da 48 GB o in una configurazione batch con più richieste.
Su Apple M3 Max (128 GB di RAM unificata)
- Magistral Small 24B Q4 : ~20–30 token/sec (stimato)
- Qwen 3 32B Q4 : ~14–22 token/sec (stimato)
I Mac Apple Silicon permettono di eseguire entrambi i modelli senza difficoltà, anche in Q8 per il 24B con 64 GB di RAM.
Licenze
Magistral Small 24B Mistral AI ha pubblicato i suoi modelli aperti con licenza Apache 2.0 o Modified MIT a seconda delle versioni. La licenza esatta di Magistral Small 24B va verificata sulla scheda ufficiale su HuggingFace prima di qualsiasi uso commerciale o redistribuzione. Non dare per scontata la licenza basandoti soltanto sulla famiglia del modello.
Qwen 3 32B Pubblicato con licenza Apache 2.0, il che consente l'uso commerciale, la modifica e la redistribuzione senza royalty, a condizione di conservare le indicazioni legali. È uno dei vantaggi concreti del Qwen 3 32B rispetto a modelli con licenze comunitarie più restrittive.
Per filtrare i modelli del catalogo per tipo di licenza, vai a quelllm.fr/catalogue.
Benchmark e confronto delle prestazioni
I risultati dei benchmark variano in base alla versione del modello, al framework di valutazione e ai parametri di generazione. I valori riportati di seguito provengono da rapporti pubblici o sono stimati — verifica sulle classifiche ufficiali come l'Open LLM Leaderboard HuggingFace prima di basare decisioni di deploy su di essi.
MMLU (conoscenza generale)
- Magistral Small 24B : ~70–76 % (da confermare)
- Qwen 3 32B : ~80–85 % (da confermare, versione instruct)
Il Qwen 3 32B beneficia della vasta quantità di dati di addestramento di Alibaba, particolarmente ricca di contenuti accademici e multilingui, il che si riflette sul MMLU.
HumanEval (coding)
- Magistral Small 24B : ~60–72 % (stimato, con modalità ragionamento attivata)
- Qwen 3 32B : ~75–85 % (stimato)
Nella pura programmazione sui benchmark standard, Qwen 3 32B mantiene il vantaggio. La modalità di ragionamento di Magistral Small può tuttavia compensare nei problemi algoritmici complessi che richiedono più fasi di scomposizione.
AIME (ragionamento matematico)
È su benchmark di ragionamento come AIME che Magistral Small 24B cerca di distinguersi. La sua progettazione orientata al chain-of-thought gli permette di affrontare problemi di matematica da competizione con una metodologia strutturata anziché tramite il riconoscimento di schemi. I punteggi precisi restano da confermare nelle classifiche pubbliche.
Posizionamento nel catalogo QualeLLM
Per posizionare questi due modelli nell'ecosistema :
- Le Mistral Medium 3.5 128B (128B, ~74 GB Q4) rappresenta il livello superiore nella gamma Mistral, fuori dalla portata di una singola GPU di fascia consumer.
- Le Mistral Small 4 (119B, ~72 GB Q4) offre una potenza Mistral superiore ma richiede anch'esso un cluster o una scheda professionale da 80 GB.
- Le Qwen 2.5 72B Instruct resta un punto di riferimento collaudato nella famiglia Qwen per chi dispone di circa 42 GB di VRAM in Q4.
Casi d'uso concreti
Quando scegliere Magistral Small 24B
- Ragionamento passo passo : analisi di codice a più fasi, debug, risoluzione di problemi logici o matematici.
- Agente autonomo leggero : la sua capacità di ragionamento strutturato ne fa un buon motore per pipeline di agenti che devono giustificare le loro decisioni.
- VRAM disponibile limitata : su una macchina con 16–24 GB, è l'opzione Mistral più accessibile che integra capacità di ragionamento avanzate.
- Velocità prioritaria : generare rapidamente (~30 t/s stimati) con una qualità di ragionamento superiore a quanto ci si aspetterebbe dalle sue dimensioni.
Quando scegliere Qwen 3 32B
- Programmazione e revisione del codice : i suoi punteggi HumanEval lo rendono una scelta migliore per l'assistenza quotidiana allo sviluppo software.
- Elaborazione multilingue : la famiglia Qwen offre nativamente buone prestazioni in cinese, giapponese, coreano e nelle lingue europee.
- Contesto lungo : 128 K token nativi per caricare documenti interi o lunghi storici di conversazione.
- Licenza Apache 2.0 senza ambiguità : distribuzione commerciale diretta senza verifica preliminare.
- Versatilità generale : scrittura, riassunto, domande e risposte, analisi dei dati — la gamma è ampia.
FAQ
Q: Il Magistral Small 24B funziona su una RTX 4090?
Sì. In Q4_K_M, richiede circa 13 GB di VRAM — una RTX 4090 (24 GB) lo esegue lasciando un margine per la cache KV con contesti brevi. In Q8, i 24 GB disponibili vengono utilizzati al massimo; contesti molto lunghi (con tutti i 32 K token occupati) possono saturare la memoria. In pratica, Q5_K_M rappresenta un buon compromesso qualità/VRAM su questa scheda.
Q: Qual è la licenza di Qwen 3 32B?
Qwen 3 32B è pubblicato con licenza Apache 2.0, una licenza permissiva che consente l'uso commerciale, la modifica e la redistribuzione. Non è richiesta alcuna royalty per l'integrazione in un prodotto o servizio, a condizione di conservare le note legali originali. È una delle licenze più favorevoli dell'ecosistema open-weights.
Q: Magistral Small 24B o Qwen 3 32B per RAG (Retrieval-Augmented Generation)?
Per il RAG, Qwen 3 32B è avvantaggiato dal suo contesto nativo di 128 K token e dalle sue elevate prestazioni nella comprensione dei documenti. Magistral Small 24B può produrre risposte meglio strutturate e argomentate a richieste complesse grazie alla sua modalità di ragionamento. La scelta dipende principalmente dalla lunghezza dei documenti acquisiti e dalla complessità delle domande poste.
Q: C'è una differenza di velocità significativa tra i due modelli?
Sì. Con 8 miliardi di parametri in meno, Magistral Small 24B è sensibilmente più veloce nella generazione sulla stessa GPU — circa il 30–50% di token al secondo in più in Q4 su RTX 4090 (stima). Questa differenza si attenua sulle GPU da 80 GB o nei deployment in batch, dove la banda passante della memoria non è più il principale fattore limitante.
Q: Magistral Small 24B supporta la modalità "thinking"?
Sì, è la sua caratteristica principale rispetto agli LLM Mistral di generazione precedente. Genera un ragionamento intermedio prima della risposta finale. L'attivazione avviene tramite il formato del prompt o un'opzione dedicata a seconda del backend utilizzato (llama.cpp, LM Studio, ecc.). I dettagli di implementazione devono essere verificati nella documentazione ufficiale di HuggingFace.
Q: Come confrontare questi modelli con altri LLM del catalogo QualeLLM?
Le catalogo QualeLLM elenca 249 modelli con specifiche di VRAM, licenze e token/sec filtrabili. Per un confronto diretto con un altro modello di dimensioni simili, il comparatore integrato consente di affiancare le schede secondo i tuoi criteri (VRAM disponibile, licenza, uso).
Conclusione
Le Magistral Small 24B e il Qwen 3 32B incarnano due filosofie per dimensioni simili: ragionamento strutturato da un lato, versatilità di un modello denso dall'altro. Se la tua priorità è la velocità di inferenza e la qualità del ragionamento passo passo su una GPU da 24 GB, il Magistral Small 24B merita di essere valutato seriamente. Se privilegi la programmazione, il contesto lungo e una licenza Apache 2.0 senza ambiguità, il Qwen 3 32B è una scelta solida. Esplora tutti i modelli filtrati per VRAM e licenza su quelllm.fr/catalogue, oppure lascia il configuratore selezionare in base alla tua configurazione esatta.