Intermedio 11 minQwen

Qwen3.6 35B-A3B in locale: test e requisiti VRAM

Qwen3.6 35B-A3B è un Mixture-of-Experts (MoE) firmato da Alibaba: 35 miliardi di parametri in totale, ma solo 3 miliardi attivati per token. Sulla carta, promette la qualità di un 30B+ con la velocità di un 3B. In pratica, l'insidia è altrove: la VRAM. Questa guida misura quanto serve davvero per eseguire qwen3.6 in locale, per ciascuna quantizzazione, e quanti token/sec si ottengono sulle schede più comuni.

Di Mohamed Meguedmi·Agg. 2026-06-03·Testato su Windows, macOS e Linux

#Perché Qwen3.6 35B-A3B in locale

Tre ragioni concrete spingono a provare questo modello invece di un classico modello denso da 32B. Innanzitutto, la velocità: solo i 3B attivi sono coinvolti nel calcolo di ogni token, quindi l'inferenza è molto più veloce rispetto a un Qwen 32B denso a parità di VRAM. Poi, la qualità: nei benchmark pubblici, il 35B-A3B tiene testa a un modello denso da 14B–24B nel ragionamento, nel codice e nel francese.

Infine, è uno dei pochi modelli a offrire questo equilibrio con una licenza permissiva utilizzabile in produzione. Se cerchi un assistente generalista preciso, che risponda velocemente e che trovi posto nella memoria di una scheda grafica da 24 GB, Qwen3.6 35B-A3B è oggi uno dei migliori candidati.

i
Il nome decodificato
35B = 35 miliardi di parametri totali. A3B = 3 miliardi di parametri "attivi" per token. Il router MoE seleziona dinamicamente alcuni esperti (su circa 64) a ogni passaggio, riducendo il costo di calcolo ma non il costo di memoria.

#Architettura MoE in un minuto

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

In un modello denso, ogni token attraversa tutti gli strati e tutti i neuroni. In un MoE, alcuni strati feed-forward vengono sostituiti da un insieme di esperti indipendenti, e una piccola rete "router" decide per ogni token quali esperti attivare (tipicamente da 2 a 8). Gli altri restano inattivi.

Calcolo per token
Proporzionale ai parametri attivi (3B). È per questo che genera velocemente.
Memoria (VRAM)
Proporzionale al totale (35B). Tutti gli esperti devono essere caricati, non si sa mai in anticipo quale sarà chiamato.
Qualità
Tra un 3B denso e un 35B denso. Per compiti generali, in pratica, si avvicina a un 14B–24B denso.
Sensibilità al batch
Con un solo prompt alla volta, il MoE eccelle. Con batch molto grandi, il vantaggio computazionale si riduce perché si finisce per attivare tutti gli esperti.
→
Perché è interessante per il self-hosting
Su una RTX 4090 da 24 GB, un Qwen 32B denso in Q4 raggiunge spesso un limite di 25–35 tok/s. Qwen3.6 35B-A3B, nella stessa VRAM, gira intorno ai 70–90 tok/s, con una qualità delle risposte comparabile nella maggior parte delle attività non specializzate.

#Requisiti hardware

VRAM minima
16 GB per testarlo (Q3, accettando un offload parziale sulla CPU). 20–24 GB per un utilizzo fluido in Q4.
VRAM con un buon margine
32 GB (RTX 5090) o 48 GB (memoria unificata Apple) per Q5/Q6 e un contesto ampio.
RAM di sistema
32 GB minimo se accetti l'offload CPU. 64 GB se carichi interamente in RAM.
Disco
Prevedere 22 GB per Q4_K_M, 70 GB per FP16. SSD NVMe fortemente consigliato.
Sistema operativo / ambiente di esecuzione
Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x o una versione recente di llama.cpp (build successiva a marzo 2026).
!
MoE ≠ modello piccolo
Non lasciarti ingannare dai "3B attivi": bisogna comunque caricare tutto il modello in VRAM. Una RTX 4060 da 8 GB non basta, anche se l'inferenza "calcola solo 3B". Tutti gli esperti devono rimanere accessibili istantaneamente.

#VRAM effettiva per quantizzazione

Ecco gli ingombri in memoria misurati con llama.cpp con un contesto di 8 k token (modello + KV-cache + overhead). I valori includono la memoria occupata dal runtime, non solo le dimensioni del GGUF su disco.

Q2_K (≈ 13 GB)
Possibile su RTX 4070 / 4060 Ti 16 GB. Perdita di qualità notevole soprattutto nella programmazione e nel ragionamento in più passaggi. Da riservare come soluzione di ripiego.
Q3_K_M (≈ 17 GB)
Entra in memoria su RX 7900 GRE / 4080 / 5070 Ti da 16 GB con un contesto modesto. Qualità ancora ragionevole per la chat generalista in francese.
Q4_K_M (≈ 22 GB)
Il punto ottimale. Sta comodamente nella memoria di RTX 3090 / 4090 / 7900 XTX (24 GB) e RTX 5090 (32 GB). La scelta consigliata di base.
Q5_K_M (≈ 26 GB)
Richiede 32 GB (RTX 5090) o un Mac della serie M con almeno 36 GB. Miglioramento modesto della qualità rispetto a Q4, tranne nella programmazione.
Q6_K (≈ 30 GB)
Riservato alle RTX 5090, ai Mac Studio o alle configurazioni multi-GPU. Pochissima differenza rispetto a Q8 nei risultati mostrati all'utente.
Q8_0 (≈ 37 GB)
Mac Studio M2/M3/M5 Ultra, o bi-GPU (2× 3090). Qualità quasi-FP16.
FP16 (≈ 70 GB)
Ricerca, fine-tuning, vLLM in produzione. Fuori gioco per la maggior parte delle configurazioni locali.
→
Quale quantizzazione scegliere
Per il 95% degli usi, Q4_K_M è la scelta predefinita giusta: preserva gran parte della qualità, risparmia VRAM e aumenta il throughput. Passa a Q5/Q6 solo se hai esplicitamente riscontrato regressioni nei tuoi prompt.

#Installazione con Ollama

Ollama resta la via più breve. Se non lo hai ancora, installalo (vedi la guida di installazione per il tuo sistema operativo). Una volta avviato il daemon sulla porta 11434, basta un solo comando.

Scaricare e avviare
ollama run qwen3.6:35b-a3b-q4_K_M

Il download pesa circa 21 GB. Al primo prompt, il modello viene caricato in VRAM; gli avvii successivi sono quasi istantanei finché il modello rimane attivo in memoria.

Verificare l'allocazione sulla GPU
ollama ps

La colonna PROCESSOR deve mostrare il 100% GPU. Se vedi un mix CPU/GPU, significa che la VRAM è insufficiente: passa a una quantizzazione più aggressiva (Q3_K_M), riduci num_ctx, o accetta la perdita di velocità.

i
Estendere il contesto
Per impostazione predefinita, Ollama limita il contesto a 2048 token. Per riassumere documenti o gestire conversazioni lunghe, crea un Modelfile che imposti num_ctx a 8192 o 16384 — ogni raddoppio richiede qualche centinaio di MB di VRAM aggiuntiva.
Modelfile minimale
# fichier : Modelfile.qwen36-long
FROM qwen3.6:35b-a3b-q4_K_M
PARAMETER num_ctx 16384
PARAMETER temperature 0.7

# build
# ollama create qwen36-long -f Modelfile.qwen36-long

#Installazione con llama.cpp

Per chi vuole controllare con precisione la posizione degli esperti, il batch o il KV-cache, llama.cpp è più flessibile. Si scarica un GGUF Q4_K_M da Hugging Face (modelli pubblicati dall'equipe Qwen o da bartowski/unsloth), poi si avvia il server compatibile con OpenAI.

Server llama.cpp
./llama-server \
  -m ./models/Qwen3.6-35B-A3B-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  -ngl 99 \
  --flash-attn \
  --threads 8
-ngl 99
Carica tutti gli strati sulla GPU. Impostare 0 per usare solo la CPU, oppure un valore intermedio per ripartire gli strati tra CPU e GPU.
-c 16384
Dimensione del contesto. Calcola circa 0,5 GB di cache KV aggiuntiva per ogni incremento di 4 k oltre il valore predefinito.
--flash-attn
Attiva Flash Attention se la tua build lo supporta (CUDA, Metal). Un netto risparmio di memoria con contesti lunghi.
--threads 8
È utile soprattutto quando parte dell'elaborazione avviene sulla CPU. Se si usa soltanto la GPU, ha poco impatto.
→
MoE e offload degli esperti
Le build recenti di llama.cpp supportano --override-tensor per collocare alcuni esperti nella RAM. Su una 4070 da 12 GB, questo permette di far rientrare la versione Q4_K_M, sacrificando parte del throughput. Cerca la documentazione "expert offload" se vuoi approfondire.

#Velocità di inferenza misurata

Misurazioni effettuate in Q4_K_M, contesto 4096, prompt breve (~200 token), generazione 512 token, batch 1. I numeri includono la fase di valutazione del prompt e la generazione.

RTX 5090 32 GB
≈ 110–125 tok/s in generazione. La fase di valutazione del prompt supera 4000 tok/s. Utilizzo fluido fino a 32 k di contesto.
RTX 4090 24 GB
≈ 80–95 tok/s. Il modello Q4 rientra nella VRAM con 16 k di contesto, senza superarne la capacità.
RTX 3090 24 GB
≈ 55–70 tok/s. Eccellente rapporto prestazioni/€ sul mercato dell'usato, ma larghezza di banda della memoria inferiore a quella della 4090.
Mac Studio M5 Max 64 GB
≈ 60–75 tok/s in Q4_K_M, ≈ 45–55 tok/s in Q8_0. Ideale per un server 24/7 silenzioso.
Radeon RX 7900 XTX 24 GB (ROCm)
≈ 45–60 tok/s. Ollama supportato, llama.cpp con ROCm/Vulkan.
RTX 4070 Ti Super 16 GB (Q3_K_M)
≈ 50–65 tok/s, contesto limitato a 4 k. A questo livello, un Qwen 14B denso rimane spesso più pertinente
i
MoE e contesto lungo
Il throughput rimane alto durante la generazione, ma il tempo di valutazione del prompt aumenta rapidamente quando si inseriscono 16 k di contesto. È normale: tutti gli esperti vengono coinvolti prima o poi durante l'elaborazione del prompt. Per il RAG, raggruppa le tue richieste in batch.

#Optimizzazioni utili

  1. 01
    Attivare Flash Attention
    Su Ollama, è automatico su GPU recenti. Su llama.cpp, aggiungere --flash-attn. Notevole risparmio di VRAM già a 8 k di contesto.
  2. 02
    Quantizzare la cache KV
    llama.cpp accetta --cache-type-k q8_0 --cache-type-v q8_0. Consente di risparmiare circa il 30% della VRAM occupata dalla cache, con una perdita di qualità quasi nulla.
  3. 03
    Diminuire il numero di esperti attivi
    Alcune varianti accettano --override-kv qwen3moe.expert_used_count=2 (invece di 4 o 8 di default). Più veloce, leggera perdita di qualità.
  4. 04
    Limitare num_ctx a quanto necessario
    16 k sono più che sufficienti per la maggior parte delle chat. 32 k+ si giustificano solo per la sintesi di documenti lunghi.
  5. 05
    Preferire batch=1 per la chat interattiva
    Il MoE perde parte del suo vantaggio con batch di grandi dimensioni: se servi più utenti contemporaneamente, considera vLLM anziché Ollama.

#Risoluzione dei problemi

OOM al caricamento su RTX 4090
Riduci num_ctx a 4096 e verifica che nessun altro processo usi la GPU (browser, gioco). Q4_K_M dovrebbe starci con un margine di 2–3 GB.
Generazione a 5 tok/s sulla RTX 4090
Il modello viene eseguito in parte sulla CPU. ollama ps mostrerà un mix CPU/GPU. Chiudi tutto, riavvia Ollama oppure passa a Q3_K_M.
Risposte incoerenti in francese
Verifica di usare la variante Instruct e non Base. Il routing MoE è sensibile alla formulazione del system prompt — sii diretto.
Primo token molto lento (>10s)
Fase di valutazione del prompt lunga: è normale con un contesto ampio su un modello MoE. Riutilizza la cache del prompt tra le richieste (opzione --prompt-cache di llama.cpp).
Modello non trovato su Ollama
L'etichetta esatta può variare (qwen3.6 vs qwen3_6 vs qwen36). Cerca su ollama.com/library prima di digitare il comando.

#Per approfondire

Ora che Qwen3.6 35B-A3B gira sul tuo sistema, ecco alcuni suggerimenti per migliorare la configurazione:

Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per capire esattamente cosa accade tra Q3, Q4 e Q5 su un modello MoE.
Open WebUI con Ollama
Un'interfaccia simile a ChatGPT, con cronologia e RAG, che si appoggia al tuo Qwen3.6 locale.
Scegliere la GPU per l'IA locale
Se hai dubbi tra una 3090 usata, una 4090 o una 5090 per questo tipo di modello MoE 30B+
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.