Qwen3.6 35B-A3B in locale: test e requisiti VRAM
Qwen3.6 35B-A3B è un Mixture-of-Experts (MoE) firmato da Alibaba: 35 miliardi di parametri in totale, ma solo 3 miliardi attivati per token. Sulla carta, promette la qualità di un 30B+ con la velocità di un 3B. In pratica, l'insidia è altrove: la VRAM. Questa guida misura quanto serve davvero per eseguire qwen3.6 in locale, per ciascuna quantizzazione, e quanti token/sec si ottengono sulle schede più comuni.
#Perché Qwen3.6 35B-A3B in locale
Tre ragioni concrete spingono a provare questo modello invece di un classico modello denso da 32B. Innanzitutto, la velocità: solo i 3B attivi sono coinvolti nel calcolo di ogni token, quindi l'inferenza è molto più veloce rispetto a un Qwen 32B denso a parità di VRAM. Poi, la qualità: nei benchmark pubblici, il 35B-A3B tiene testa a un modello denso da 14B–24B nel ragionamento, nel codice e nel francese.
Infine, è uno dei pochi modelli a offrire questo equilibrio con una licenza permissiva utilizzabile in produzione. Se cerchi un assistente generalista preciso, che risponda velocemente e che trovi posto nella memoria di una scheda grafica da 24 GB, Qwen3.6 35B-A3B è oggi uno dei migliori candidati.
#Architettura MoE in un minuto
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
In un modello denso, ogni token attraversa tutti gli strati e tutti i neuroni. In un MoE, alcuni strati feed-forward vengono sostituiti da un insieme di esperti indipendenti, e una piccola rete "router" decide per ogni token quali esperti attivare (tipicamente da 2 a 8). Gli altri restano inattivi.
- Calcolo per token
- Proporzionale ai parametri attivi (3B). È per questo che genera velocemente.
- Memoria (VRAM)
- Proporzionale al totale (35B). Tutti gli esperti devono essere caricati, non si sa mai in anticipo quale sarà chiamato.
- Qualità
- Tra un 3B denso e un 35B denso. Per compiti generali, in pratica, si avvicina a un 14B–24B denso.
- Sensibilità al batch
- Con un solo prompt alla volta, il MoE eccelle. Con batch molto grandi, il vantaggio computazionale si riduce perché si finisce per attivare tutti gli esperti.
#Requisiti hardware
- VRAM minima
- 16 GB per testarlo (Q3, accettando un offload parziale sulla CPU). 20–24 GB per un utilizzo fluido in Q4.
- VRAM con un buon margine
- 32 GB (RTX 5090) o 48 GB (memoria unificata Apple) per Q5/Q6 e un contesto ampio.
- RAM di sistema
- 32 GB minimo se accetti l'offload CPU. 64 GB se carichi interamente in RAM.
- Disco
- Prevedere 22 GB per Q4_K_M, 70 GB per FP16. SSD NVMe fortemente consigliato.
- Sistema operativo / ambiente di esecuzione
- Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x o una versione recente di llama.cpp (build successiva a marzo 2026).
#VRAM effettiva per quantizzazione
Ecco gli ingombri in memoria misurati con llama.cpp con un contesto di 8 k token (modello + KV-cache + overhead). I valori includono la memoria occupata dal runtime, non solo le dimensioni del GGUF su disco.
- Q2_K (≈ 13 GB)
- Possibile su RTX 4070 / 4060 Ti 16 GB. Perdita di qualità notevole soprattutto nella programmazione e nel ragionamento in più passaggi. Da riservare come soluzione di ripiego.
- Q3_K_M (≈ 17 GB)
- Entra in memoria su RX 7900 GRE / 4080 / 5070 Ti da 16 GB con un contesto modesto. Qualità ancora ragionevole per la chat generalista in francese.
- Q4_K_M (≈ 22 GB)
- Il punto ottimale. Sta comodamente nella memoria di RTX 3090 / 4090 / 7900 XTX (24 GB) e RTX 5090 (32 GB). La scelta consigliata di base.
- Q5_K_M (≈ 26 GB)
- Richiede 32 GB (RTX 5090) o un Mac della serie M con almeno 36 GB. Miglioramento modesto della qualità rispetto a Q4, tranne nella programmazione.
- Q6_K (≈ 30 GB)
- Riservato alle RTX 5090, ai Mac Studio o alle configurazioni multi-GPU. Pochissima differenza rispetto a Q8 nei risultati mostrati all'utente.
- Q8_0 (≈ 37 GB)
- Mac Studio M2/M3/M5 Ultra, o bi-GPU (2× 3090). Qualità quasi-FP16.
- FP16 (≈ 70 GB)
- Ricerca, fine-tuning, vLLM in produzione. Fuori gioco per la maggior parte delle configurazioni locali.
#Installazione con Ollama
Ollama resta la via più breve. Se non lo hai ancora, installalo (vedi la guida di installazione per il tuo sistema operativo). Una volta avviato il daemon sulla porta 11434, basta un solo comando.
Il download pesa circa 21 GB. Al primo prompt, il modello viene caricato in VRAM; gli avvii successivi sono quasi istantanei finché il modello rimane attivo in memoria.
La colonna PROCESSOR deve mostrare il 100% GPU. Se vedi un mix CPU/GPU, significa che la VRAM è insufficiente: passa a una quantizzazione più aggressiva (Q3_K_M), riduci num_ctx, o accetta la perdita di velocità.
#Installazione con llama.cpp
Per chi vuole controllare con precisione la posizione degli esperti, il batch o il KV-cache, llama.cpp è più flessibile. Si scarica un GGUF Q4_K_M da Hugging Face (modelli pubblicati dall'equipe Qwen o da bartowski/unsloth), poi si avvia il server compatibile con OpenAI.
- -ngl 99
- Carica tutti gli strati sulla GPU. Impostare 0 per usare solo la CPU, oppure un valore intermedio per ripartire gli strati tra CPU e GPU.
- -c 16384
- Dimensione del contesto. Calcola circa 0,5 GB di cache KV aggiuntiva per ogni incremento di 4 k oltre il valore predefinito.
- --flash-attn
- Attiva Flash Attention se la tua build lo supporta (CUDA, Metal). Un netto risparmio di memoria con contesti lunghi.
- --threads 8
- È utile soprattutto quando parte dell'elaborazione avviene sulla CPU. Se si usa soltanto la GPU, ha poco impatto.
#Velocità di inferenza misurata
Misurazioni effettuate in Q4_K_M, contesto 4096, prompt breve (~200 token), generazione 512 token, batch 1. I numeri includono la fase di valutazione del prompt e la generazione.
- RTX 5090 32 GB
- ≈ 110–125 tok/s in generazione. La fase di valutazione del prompt supera 4000 tok/s. Utilizzo fluido fino a 32 k di contesto.
- RTX 4090 24 GB
- ≈ 80–95 tok/s. Il modello Q4 rientra nella VRAM con 16 k di contesto, senza superarne la capacità.
- RTX 3090 24 GB
- ≈ 55–70 tok/s. Eccellente rapporto prestazioni/€ sul mercato dell'usato, ma larghezza di banda della memoria inferiore a quella della 4090.
- Mac Studio M5 Max 64 GB
- ≈ 60–75 tok/s in Q4_K_M, ≈ 45–55 tok/s in Q8_0. Ideale per un server 24/7 silenzioso.
- Radeon RX 7900 XTX 24 GB (ROCm)
- ≈ 45–60 tok/s. Ollama supportato, llama.cpp con ROCm/Vulkan.
- RTX 4070 Ti Super 16 GB (Q3_K_M)
- ≈ 50–65 tok/s, contesto limitato a 4 k. A questo livello, un Qwen 14B denso rimane spesso più pertinente
#Optimizzazioni utili
- 01Attivare Flash AttentionSu Ollama, è automatico su GPU recenti. Su llama.cpp, aggiungere --flash-attn. Notevole risparmio di VRAM già a 8 k di contesto.
- 02Quantizzare la cache KVllama.cpp accetta --cache-type-k q8_0 --cache-type-v q8_0. Consente di risparmiare circa il 30% della VRAM occupata dalla cache, con una perdita di qualità quasi nulla.
- 03Diminuire il numero di esperti attiviAlcune varianti accettano --override-kv qwen3moe.expert_used_count=2 (invece di 4 o 8 di default). Più veloce, leggera perdita di qualità.
- 04Limitare num_ctx a quanto necessario16 k sono più che sufficienti per la maggior parte delle chat. 32 k+ si giustificano solo per la sintesi di documenti lunghi.
- 05Preferire batch=1 per la chat interattivaIl MoE perde parte del suo vantaggio con batch di grandi dimensioni: se servi più utenti contemporaneamente, considera vLLM anziché Ollama.
#Risoluzione dei problemi
- OOM al caricamento su RTX 4090
- Riduci num_ctx a 4096 e verifica che nessun altro processo usi la GPU (browser, gioco). Q4_K_M dovrebbe starci con un margine di 2–3 GB.
- Generazione a 5 tok/s sulla RTX 4090
- Il modello viene eseguito in parte sulla CPU. ollama ps mostrerà un mix CPU/GPU. Chiudi tutto, riavvia Ollama oppure passa a Q3_K_M.
- Risposte incoerenti in francese
- Verifica di usare la variante Instruct e non Base. Il routing MoE è sensibile alla formulazione del system prompt — sii diretto.
- Primo token molto lento (>10s)
- Fase di valutazione del prompt lunga: è normale con un contesto ampio su un modello MoE. Riutilizza la cache del prompt tra le richieste (opzione --prompt-cache di llama.cpp).
- Modello non trovato su Ollama
- L'etichetta esatta può variare (qwen3.6 vs qwen3_6 vs qwen36). Cerca su ollama.com/library prima di digitare il comando.
#Per approfondire
Ora che Qwen3.6 35B-A3B gira sul tuo sistema, ecco alcuni suggerimenti per migliorare la configurazione:
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per capire esattamente cosa accade tra Q3, Q4 e Q5 su un modello MoE.
- Open WebUI con Ollama
- Un'interfaccia simile a ChatGPT, con cronologia e RAG, che si appoggia al tuo Qwen3.6 locale.
- Scegliere la GPU per l'IA locale
- Se hai dubbi tra una 3090 usata, una 4090 o una 5090 per questo tipo di modello MoE 30B+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.