Principiante 12 minModelli

Qwen 3 in locale: test completo e benchmark reali

Qwen 3 è diventato il riferimento open-weight per molte persone che eseguono un LLM in locale. Ma tra le versioni dense (8B, 14B, 32B) e la versione MoE 30B-A3B, è facile perdersi. Questo benchmark di Qwen3 con Ollama mette alla prova tre varianti su tre macchine molto diverse — RTX 4090, RTX 3060 12 GB, MacBook Pro M4 Pro — per fornire dati reali e un verdetto senza giri di parole.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
i
In breve
Qwen 3 è disponibile in versioni dense (8B, 14B, 32B) e MoE (30B-A3B, 3B di parametri attivi su 30). · Su RTX 4090, puoi aspettarti circa 95 tok/s con l'8B, 78 tok/s con il 14B e 110 tok/s con il 30B-A3B — il MoE è più veloce dell'8B denso. · Su RTX 3060 12 GB, il 14B (circa 32 tok/s) resta il miglior compromesso; il 30B-A3B non entra nella VRAM di questa scheda. · Su Mac M4 Pro, puoi aspettarti rispettivamente 38, 24 e 45 tok/s.

#La gamma Qwen 3: modelli densi vs MoE

Alibaba ha pubblicato Qwen 3 in due famiglie distinte. I modelli densi (Qwen3-1.7B, 4B, 8B, 14B, 32B) seguono l'architettura classica: tutti i parametri vengono utilizzati per ogni token. La famiglia MoE (Qwen3-30B-A3B, Qwen3-235B-A22B) attiva solo una frazione degli esperti per token — da cui il suffisso A3B = 3 miliardi di parametri attivi su 30 totali.

In concreto, per chi usa il modello in locale cambiano due cose: la VRAM necessaria corrisponde ai parametri totali (l'intero modello deve stare in memoria), ma la velocità corrisponde ai parametri attivi. Un MoE 30B-A3B sta in 19 GB in Q4 come un modello denso 32B, ma genera i token alla velocità di un 3B. È questo che lo rende così interessante.

i
Le tre varianti del test
Ci concentriamo su Qwen3-8B (denso), Qwen3-14B (denso) e Qwen3-30B-A3B (MoE). Sono le tre taglie che la maggior parte delle configurazioni da 12 a 24 GB può far funzionare agevolmente.

#Configurazione e hardware testato

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Tre macchine coprono all'incirca l'intero spettro dell'esecuzione in locale nel 2026:

RTX 4090 24 GB
PC tower con Windows 11, Ryzen 9 7950X, 64 GB DDR5. Il top di gamma del mercato consumer.
RTX 3060 12 GB
PC tower con Linux Ubuntu 24.04, Ryzen 5 5600X, 32 GB DDR4. La configurazione economica più popolare.
MacBook Pro M4 Pro 48 GB
macOS 15, GPU con 16 core, memoria unificata. Rappresentativo dei laptop di alto livello Apple.

Backend identico ovunque: Ollama (daemon su localhost:11434). Tutti i modelli in Q4_K_M di default, contesto di 8192 token, prompt standardizzato di circa 500 token. Velocità misurata su 10 generazioni di 500 token in media.

Recuperare i tre modelli
ollama pull qwen3:8b
ollama pull qwen3:14b
ollama pull qwen3:30b-a3b
→
Misurare a casa tua
Per riprodurre questo test, aggiungi --verbose a ollama run. Ollama mostra eval rate (token/sec in generazione) e prompt eval rate (velocità di prefill) alla fine di ogni risposta.

#Qwen3-8B: il modello denso di fascia base

Modello denso con 8 miliardi di parametri, ~5 GB in Q4_K_M. Progettato per funzionare ovunque: 8 GB di VRAM sono più che sufficienti. È il candidato naturale quando si scopre Qwen 3 su una RTX 3060 o un laptop.

RTX 4090
~95 token/sec. La scheda è largamente sottoutilizzata — tutta la VRAM disponibile è sottoutilizzata a questo livello.
RTX 3060 12 GB
~52 token/sec. L'uso è molto agevole: siamo ben al di sopra della soglia di fluidità (20 t/s).
M4 Pro 48 GB
~38 token al secondo. Velocità inferiore a quella delle RTX, ma ampiamente sufficiente per l'uso, e nessun rumore delle ventole.

Quanto alla qualità, Qwen3-8B svolge molto bene i compiti comuni: riassunti, riformulazioni, codice semplice, domande e risposte. Viene nettamente superato quando si passa al ragionamento in più passaggi o al codice non banale: è lì che si avvertono i limiti di un 8B. Il francese è corretto ma non eccellente; si notano alcuni anglicismi e costruzioni strane.

#Qwen3-14B: il punto di equilibrio tra i modelli densi

Denso da 14B, circa 9 GB in Q4_K_M. Entra senza problemi in 12 GB di VRAM con un contesto ragionevole. È il modello che consigliamo al 90% delle persone che hanno una RTX 3060 12 GB, una 4070 o una scheda equivalente.

RTX 4090
~78 token/sec. Velocità eccellente, ancora lontani dal limite GPU.
RTX 3060 12 GB
~32 token/sec. Adeguato per l’uso in chat; un contesto di 8k rientra in memoria senza offload.
M4 Pro 48 GB
~24 token/sec. Al limite di una velocità confortevole, ma utilizzabile ogni giorno.

L'incremento di qualità rispetto all'8B è netto. Codice Python corretto su funzioni di 50-80 righe, ragionamento più solido, francese davvero migliore (espressioni naturali, pochi errori di genere). È il primo modello della serie che sembra davvero un assistente cloud entry-level in termini di coerenza.

!
Contesto predefinito Ollama
Ollama limita il contesto a 2048 token per impostazione predefinita, il che è ridicolo per Qwen 3 (che supporta nativamente 32k). Imposta esplicitamente num_ctx tramite un Modelfile o tramite /set parameter num_ctx 8192 nella sessione, altrimenti tronchi le conversazioni lunghe.

#Qwen3-30B-A3B: il MoE che cambia tutto

È qui che diventa interessante. Il 30B-A3B pesa circa 19 GB in Q4_K_M (= servono 24 GB di VRAM per farlo funzionare comodamente con un contesto), ma genera con soli 3B di parametri attivi. Risultato: qualità di un 30B, velocità di un 3B.

RTX 4090
~110 token/sec. Sì, più veloce dell'8B denso. È la magia del MoE: meno calcoli per token.
RTX 3060 12 GB
Non entra interamente in VRAM. Offload parziale sulla CPU ≈ 8 t/s — utilizzabile per fare test, ma frustrante.
M4 Pro 48 GB
~45 token/sec. La memoria unificata brilla qui: tutto entra in RAM, e il MoE compensa i FLOPS limitati.

La qualità è molto vicina a quella di un Qwen 32B denso. Il 30B-A3B eccelle particolarmente nella programmazione (allo stesso livello di un Qwen3-Coder 30B-A3B su compiti Python di difficoltà intermedia) e nel ragionamento strutturato. Nel francese scritto è davvero valido — al livello di un Mistral Small 24B, per dare un riferimento.

→
Il verdetto sorprendente
Se hai 24 GB di VRAM o un Mac con almeno 32 GB di memoria unificata, Qwen3-30B-A3B resta un eccellente MoE generalista: qualità migliore E velocità superiore rispetto al 14B denso, senza compromessi. Dopo questo test, la generazione successiva ha preso il suo posto in questa fascia — Qwen 3.8 27B (quello « vicino a Copilot » del 2026, con 262k di contesto) e Qwen 3.6 35B-A3B, una scelta affidabile per le configurazioni da 24 a 32 GB. Il 30B-A3B misurato qui conserva tutto il DNA MoE.

#Modalità Thinking: utile o no?

Qwen 3 introduce una modalità di ragionamento attivabile e disattivabile. Quando è attivata, il modello genera prima un blocco <think>...</think> con il proprio ragionamento, poi produce la risposta finale. Si ispira a DeepSeek R1, ma è più modulare: si può attivare o disattivare al volo.

Attivare o disattivare il thinking
# Dans la session Ollama
/set parameter think true
/set parameter think false

# Ou via prompt direct (Qwen 3 reconnaît les balises)
>>> /think Combien fait 17 × 23 ?
>>> /no_think Salut, ça va ?

Cosa si osserva su 50 prompt testati:

Compiti semplici (chat, riformulazione)
Thinking mode = perdita di tempo. Aggiunge da 2 a 5 secondi di latenza senza alcun miglioramento della qualità. Disattivalo.
Matematica, logica, ragionamento a più fasi
Incremento netto della precisione: dal +20 al +30% di risposte corrette su problemi di tipo GSM8K. Mantenere attivo.
Codice complesso (refactoring, debug)
Incremento moderato (+10 %) in qualità, ma doppia latenza. Da testare in base alla tua pazienza.
Generazione creativa (testo lungo, dialogo)
Spesso controproducente: il modello riflette eccessivamente e perde spontaneità.
i
Costo in token
Un tipico blocco <think> contiene da 500 a 2000 token aggiuntivi prima della risposta. Su un 30B-A3B a 100 t/s è impercettibile. Su un 14B a 30 t/s, aggiunge da 10 a 60 secondi di latenza — valuta le tue priorità.

#Qualità in francese rispetto a Llama 4

Abbiamo confrontato i risultati in francese di Qwen3-14B e Qwen3-30B-A3B con quelli di Llama 4 Scout (il modello Meta equivalente, uscito nello stesso periodo) su tre esercizi: redazione di un'email professionale, spiegazione divulgativa di un concetto tecnico e analisi di un breve testo letterario.

Qwen3-14B
Francese corretto, formulazioni naturali, ma persistono alcuni errori di genere (« la problème »). Lessico un po' piatto.
Qwen3-30B-A3B
Ottimo francese scritto. Nessun errore strutturale, lessico vario, registro adatto al contesto. Leggermente inferiore a Mistral Small 24B nelle sfumature più marcatamente idiomatiche.
Llama 4 Scout
Francese impeccabile dal punto di vista grammaticale, ma con un tono più «tradotto dall'inglese» rispetto a Qwen. Preferenze personali.

Verdetto pratico: per il francese professionale, Qwen3-30B-A3B e Llama 4 Scout sono alla pari. La scelta si basa su altri criteri (velocità, dimensione, licenza). Per il francese letterario o molto idiomatico, Mistral Small resta un passo avanti.


#Quale Qwen 3 scegliere in base alla tua configurazione?

6-8 GB di VRAM (RTX 3050, 3060 Ti, 4060)
Qwen3-8B in Q4_K_M. Il 14B ci sta in Q3, ma la qualità peggiora — resta sull'8B con una buona qualità.
12 GB di VRAM (RTX 3060 12, 4070, 5070)
Qwen3-14B in Q4_K_M è senza dubbio il punto di equilibrio ideale. Un contesto da 16k è gestibile senza difficoltà.
16 GB (RTX 4080, 5070 Ti, 5080)
Qwen3-14B in Q5 o Q6 per un utilizzo confortevole, oppure un 30B-A3B in Q3_K_M se vuoi provare il MoE.
24 GB (RTX 3090, 4090, RX 7900 XTX)
Qwen3-30B-A3B in Q4_K_M. Non c'è discussione: è il miglior modello locale generalista disponibile oggi.
Mac con chip della serie M e 32–48 GB di memoria unificata
Qwen3-30B-A3B in Q4 o Q5. Il MoE si adatta particolarmente bene alla memoria unificata Apple.
Mac Studio Ultra 128 GB+
Passa direttamente a Qwen3-235B-A22B (~120 GB in Q4) se vuoi il top della gamma. Altrimenti il 30B-A3B in Q8 resta eccellente.
→
E il thinking mode in tutto questo?
Per impostazione predefinita, lascialo disattivato. Attivalo quando serve, per affrontare un problema di matematica, logica o ragionamento complesso. Per le conversazioni quotidiane, aggiunge solo latenza. La stessa logica vale per la generazione successiva: Qwen 3.8 27B tende a ragionare eccessivamente con la sua impostazione di ragionamento predefinita — impostala su low per gli scambi abituali.

#Per approfondire

Se Qwen 3 è il tuo punto di partenza, sappi che nel frattempo la generazione successiva ne ha preso il posto nelle nostre classifiche — Qwen 3.5 9B è diventato la scelta predefinita per le configurazioni da 8 GB (256k di contesto, visione) e Qwen 3.8 27B per quelle da 24 GB; le impostazioni qui sotto restano valide senza modifiche anche per questi modelli. Alcuni suggerimenti per approfondire:

Scegliere la quantizzazione
Per capire esattamente cosa perdi tra Q4_K_M e Q5_K_M su Qwen 3 e quando ha senso passare a una quantizzazione a maggiore precisione.
Personalizzare con un Modelfile
Per impostare il thinking mode, il contesto e un system prompt in francese come impostazioni predefinite sulla tua istanza Qwen 3 — invece di riconfigurarli a ogni sessione.
Open WebUI con Ollama
Per passare dal terminale a una vera interfaccia di chat con cronologia, markdown e allegati, senza rinunciare all'esecuzione locale.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.