Qwen 3 in locale: test completo e benchmark reali
Qwen 3 è diventato il riferimento open-weight per molte persone che eseguono un LLM in locale. Ma tra le versioni dense (8B, 14B, 32B) e la versione MoE 30B-A3B, è facile perdersi. Questo benchmark di Qwen3 con Ollama mette alla prova tre varianti su tre macchine molto diverse — RTX 4090, RTX 3060 12 GB, MacBook Pro M4 Pro — per fornire dati reali e un verdetto senza giri di parole.
#La gamma Qwen 3: modelli densi vs MoE
Alibaba ha pubblicato Qwen 3 in due famiglie distinte. I modelli densi (Qwen3-1.7B, 4B, 8B, 14B, 32B) seguono l'architettura classica: tutti i parametri vengono utilizzati per ogni token. La famiglia MoE (Qwen3-30B-A3B, Qwen3-235B-A22B) attiva solo una frazione degli esperti per token — da cui il suffisso A3B = 3 miliardi di parametri attivi su 30 totali.
In concreto, per chi usa il modello in locale cambiano due cose: la VRAM necessaria corrisponde ai parametri totali (l'intero modello deve stare in memoria), ma la velocità corrisponde ai parametri attivi. Un MoE 30B-A3B sta in 19 GB in Q4 come un modello denso 32B, ma genera i token alla velocità di un 3B. È questo che lo rende così interessante.
#Configurazione e hardware testato
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Tre macchine coprono all'incirca l'intero spettro dell'esecuzione in locale nel 2026:
- RTX 4090 24 GB
- PC tower con Windows 11, Ryzen 9 7950X, 64 GB DDR5. Il top di gamma del mercato consumer.
- RTX 3060 12 GB
- PC tower con Linux Ubuntu 24.04, Ryzen 5 5600X, 32 GB DDR4. La configurazione economica più popolare.
- MacBook Pro M4 Pro 48 GB
- macOS 15, GPU con 16 core, memoria unificata. Rappresentativo dei laptop di alto livello Apple.
Backend identico ovunque: Ollama (daemon su localhost:11434). Tutti i modelli in Q4_K_M di default, contesto di 8192 token, prompt standardizzato di circa 500 token. Velocità misurata su 10 generazioni di 500 token in media.
#Qwen3-8B: il modello denso di fascia base
Modello denso con 8 miliardi di parametri, ~5 GB in Q4_K_M. Progettato per funzionare ovunque: 8 GB di VRAM sono più che sufficienti. È il candidato naturale quando si scopre Qwen 3 su una RTX 3060 o un laptop.
- RTX 4090
- ~95 token/sec. La scheda è largamente sottoutilizzata — tutta la VRAM disponibile è sottoutilizzata a questo livello.
- RTX 3060 12 GB
- ~52 token/sec. L'uso è molto agevole: siamo ben al di sopra della soglia di fluidità (20 t/s).
- M4 Pro 48 GB
- ~38 token al secondo. Velocità inferiore a quella delle RTX, ma ampiamente sufficiente per l'uso, e nessun rumore delle ventole.
Quanto alla qualità, Qwen3-8B svolge molto bene i compiti comuni: riassunti, riformulazioni, codice semplice, domande e risposte. Viene nettamente superato quando si passa al ragionamento in più passaggi o al codice non banale: è lì che si avvertono i limiti di un 8B. Il francese è corretto ma non eccellente; si notano alcuni anglicismi e costruzioni strane.
#Qwen3-14B: il punto di equilibrio tra i modelli densi
Denso da 14B, circa 9 GB in Q4_K_M. Entra senza problemi in 12 GB di VRAM con un contesto ragionevole. È il modello che consigliamo al 90% delle persone che hanno una RTX 3060 12 GB, una 4070 o una scheda equivalente.
- RTX 4090
- ~78 token/sec. Velocità eccellente, ancora lontani dal limite GPU.
- RTX 3060 12 GB
- ~32 token/sec. Adeguato per l’uso in chat; un contesto di 8k rientra in memoria senza offload.
- M4 Pro 48 GB
- ~24 token/sec. Al limite di una velocità confortevole, ma utilizzabile ogni giorno.
L'incremento di qualità rispetto all'8B è netto. Codice Python corretto su funzioni di 50-80 righe, ragionamento più solido, francese davvero migliore (espressioni naturali, pochi errori di genere). È il primo modello della serie che sembra davvero un assistente cloud entry-level in termini di coerenza.
#Qwen3-30B-A3B: il MoE che cambia tutto
È qui che diventa interessante. Il 30B-A3B pesa circa 19 GB in Q4_K_M (= servono 24 GB di VRAM per farlo funzionare comodamente con un contesto), ma genera con soli 3B di parametri attivi. Risultato: qualità di un 30B, velocità di un 3B.
- RTX 4090
- ~110 token/sec. Sì, più veloce dell'8B denso. È la magia del MoE: meno calcoli per token.
- RTX 3060 12 GB
- Non entra interamente in VRAM. Offload parziale sulla CPU ≈ 8 t/s — utilizzabile per fare test, ma frustrante.
- M4 Pro 48 GB
- ~45 token/sec. La memoria unificata brilla qui: tutto entra in RAM, e il MoE compensa i FLOPS limitati.
La qualità è molto vicina a quella di un Qwen 32B denso. Il 30B-A3B eccelle particolarmente nella programmazione (allo stesso livello di un Qwen3-Coder 30B-A3B su compiti Python di difficoltà intermedia) e nel ragionamento strutturato. Nel francese scritto è davvero valido — al livello di un Mistral Small 24B, per dare un riferimento.
#Modalità Thinking: utile o no?
Qwen 3 introduce una modalità di ragionamento attivabile e disattivabile. Quando è attivata, il modello genera prima un blocco <think>...</think> con il proprio ragionamento, poi produce la risposta finale. Si ispira a DeepSeek R1, ma è più modulare: si può attivare o disattivare al volo.
Cosa si osserva su 50 prompt testati:
- Compiti semplici (chat, riformulazione)
- Thinking mode = perdita di tempo. Aggiunge da 2 a 5 secondi di latenza senza alcun miglioramento della qualità. Disattivalo.
- Matematica, logica, ragionamento a più fasi
- Incremento netto della precisione: dal +20 al +30% di risposte corrette su problemi di tipo GSM8K. Mantenere attivo.
- Codice complesso (refactoring, debug)
- Incremento moderato (+10 %) in qualità, ma doppia latenza. Da testare in base alla tua pazienza.
- Generazione creativa (testo lungo, dialogo)
- Spesso controproducente: il modello riflette eccessivamente e perde spontaneità.
#Qualità in francese rispetto a Llama 4
Abbiamo confrontato i risultati in francese di Qwen3-14B e Qwen3-30B-A3B con quelli di Llama 4 Scout (il modello Meta equivalente, uscito nello stesso periodo) su tre esercizi: redazione di un'email professionale, spiegazione divulgativa di un concetto tecnico e analisi di un breve testo letterario.
- Qwen3-14B
- Francese corretto, formulazioni naturali, ma persistono alcuni errori di genere (« la problème »). Lessico un po' piatto.
- Qwen3-30B-A3B
- Ottimo francese scritto. Nessun errore strutturale, lessico vario, registro adatto al contesto. Leggermente inferiore a Mistral Small 24B nelle sfumature più marcatamente idiomatiche.
- Llama 4 Scout
- Francese impeccabile dal punto di vista grammaticale, ma con un tono più «tradotto dall'inglese» rispetto a Qwen. Preferenze personali.
Verdetto pratico: per il francese professionale, Qwen3-30B-A3B e Llama 4 Scout sono alla pari. La scelta si basa su altri criteri (velocità, dimensione, licenza). Per il francese letterario o molto idiomatico, Mistral Small resta un passo avanti.
#Quale Qwen 3 scegliere in base alla tua configurazione?
- 6-8 GB di VRAM (RTX 3050, 3060 Ti, 4060)
- Qwen3-8B in Q4_K_M. Il 14B ci sta in Q3, ma la qualità peggiora — resta sull'8B con una buona qualità.
- 12 GB di VRAM (RTX 3060 12, 4070, 5070)
- Qwen3-14B in Q4_K_M è senza dubbio il punto di equilibrio ideale. Un contesto da 16k è gestibile senza difficoltà.
- 16 GB (RTX 4080, 5070 Ti, 5080)
- Qwen3-14B in Q5 o Q6 per un utilizzo confortevole, oppure un 30B-A3B in Q3_K_M se vuoi provare il MoE.
- 24 GB (RTX 3090, 4090, RX 7900 XTX)
- Qwen3-30B-A3B in Q4_K_M. Non c'è discussione: è il miglior modello locale generalista disponibile oggi.
- Mac con chip della serie M e 32–48 GB di memoria unificata
- Qwen3-30B-A3B in Q4 o Q5. Il MoE si adatta particolarmente bene alla memoria unificata Apple.
- Mac Studio Ultra 128 GB+
- Passa direttamente a Qwen3-235B-A22B (~120 GB in Q4) se vuoi il top della gamma. Altrimenti il 30B-A3B in Q8 resta eccellente.
#Per approfondire
Se Qwen 3 è il tuo punto di partenza, sappi che nel frattempo la generazione successiva ne ha preso il posto nelle nostre classifiche — Qwen 3.5 9B è diventato la scelta predefinita per le configurazioni da 8 GB (256k di contesto, visione) e Qwen 3.8 27B per quelle da 24 GB; le impostazioni qui sotto restano valide senza modifiche anche per questi modelli. Alcuni suggerimenti per approfondire:
- Scegliere la quantizzazione
- Per capire esattamente cosa perdi tra Q4_K_M e Q5_K_M su Qwen 3 e quando ha senso passare a una quantizzazione a maggiore precisione.
- Personalizzare con un Modelfile
- Per impostare il thinking mode, il contesto e un system prompt in francese come impostazioni predefinite sulla tua istanza Qwen 3 — invece di riconfigurarli a ogni sessione.
- Open WebUI con Ollama
- Per passare dal terminale a una vera interfaccia di chat con cronologia, markdown e allegati, senza rinunciare all'esecuzione locale.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.