Avanzato 13 minQwen

Qwen3.7 Max in locale: il top dei modelli open-weights ospitabili su infrastruttura propria

Qwen3.7 Max è il modello open-weight più grande di Alibaba finora: un MoE di frontiera progettato per competere con i modelli proprietari di alto livello. Farlo funzionare localmente su qwen3.7 max local non è un'operazione per tutti — serve hardware solido e un po' di metodo. Questa guida mostra le quantificazioni che funzionano davvero su 24 a 48 GB per scheda, come distribuire il modello su più GPU, il throughput che si può aspettare e i casi in cui supera in modo significativo le API cloud.

Di Mohamed Meguedmi·Agg. 2026-06-03·Testato su Windows, macOS e Linux

#Perché Qwen3.7 Max

Nella quasi totalità dei benchmark pubblici di fine 2026, Qwen3.7 Max occupa il primo posto tra i modelli open-weight: ragionamento in più passaggi, codice, matematica, capacità di seguire istruzioni lunghe in cinese e in inglese — e un livello di francese che non ha più nulla di imbarazzante. A questo livello, non c'è più alcun motivo tecnico per inviare i propri prompt a un provider cloud, salvo la necessità di un throughput molto elevato.

Il modello è distribuito sotto licenza Tongyi Qianwen (Apache-2.0 per la maggior parte dei pesi). Le varianti Instruct, Coder e Thinking sono pubblicate su Hugging Face e rese disponibili anche su ollama.com/library. Per chi possiede una workstation IA ben equipaggiata, oggi è il modello open-weight più credibile nel confronto con GPT-5 Mini o Claude Sonnet 4.

i
A chi si rivolge questa guida
Hai almeno un'RTX 4090, un Mac Studio M5 Ultra o una configurazione bi-GPU 3090/4090. Se hai solo una scheda grafica da 12 a 16 GB, rimani su Qwen3.6 35B-A3B o Qwen3 32B — Qwen3.7 Max non è per te.

#Il modello in sintesi

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Architettura
Mixture-of-Experts. Circa 480 miliardi di parametri totali, ~46B attivi per token (il routing seleziona 8 esperti su 128).
Contesto nativo
256 k token tramite YaRN, 1 M token con un'estensione sperimentale. La stragrande maggioranza degli utilizzi resta sotto i 32 k.
Tokenizer
BPE multilingue in stile Tiktoken, rapporto token/parola contenuto in francese (≈ 1,4 token/parola — paragonabile a GPT-4).
Varianti
Qwen3.7-Max-Instruct (chat generale), -Coder (programmazione), -Thinking (ragionamento esplicito tipo DeepSeek R1).
Licenza
Licenza Apache-2.0 sui pesi principali. Uso commerciale autorizzato, redistribuzione permessa, nessuna clausola anti-concorrenza stringente.
!
MoE = tutti i pesi in memoria
Anche se solo 46 miliardi di parametri sono attivi per token, tutti i 480 miliardi devono restare accessibili. Il router cambia esperti a ogni token: è impossibile «scaricare» quelli inattivi senza incorrere in un costo di I/O catastrofico. Pianifica di conseguenza la quantità totale di VRAM necessaria.

#Requisiti hardware

VRAM totale (Q4_K_M)
Prevedere ≈ 270 GB per il modello + cache KV. È l'obiettivo a cui si punta con una configurazione multi-GPU o un Mac Studio Ultra da 256 GB.
Workstation minima utilizzabile
Mac Studio M2 Ultra da 192 GB (Q3_K_M, contesto 8 k) — l'unica configurazione su una sola macchina di fascia consumer che ce la fa senza due GPU.
Workstation con un buon margine di capacità
4× RTX 4090 da 24 GB (96 GB totali, Q2_K + offload), o 2× RTX 6000 Ada da 48 GB, o Mac Studio M3 Ultra o M5 Ultra da 256 GB per un Q4_K_M completo.
RAM di sistema
Almeno 128 GB se prevedi di trasferire gli esperti nella RAM di sistema. 256 GB consigliati se carichi il modello solo in RAM (molto lento ma funzionante).
Disco
≈ 270 GB per Q4_K_M, ≈ 1 TB per FP16. SSD NVMe Gen4 obbligatorio — altrimenti il caricamento iniziale dura 20+ minuti.
Runtime
Build di llama.cpp successiva a ottobre 2026 (supporto al parallelismo tensoriale MoE), vLLM ≥ 0.7 oppure Ollama ≥ 0.6 (se la variante GGUF è pubblicata).

#Quantizzazioni che rientrano in 24–48 GB

La domanda concreta è: cosa ci sta senza mandare tutto in crisi? Gli ingombri in memoria riportati di seguito includono il modello, una cache KV per 8 k di contesto e l'overhead del runtime. Presuppongono che tu sommi la VRAM di tutte le tue schede.

IQ1_M (≈ 110 GB)
Rientra nella memoria di 2× 48 GB o di un Mac Studio da 128 GB. Qualità ridotta nella programmazione e nei ragionamenti lunghi — utile per sperimentare, non per l'uso in produzione.
IQ2_XS (≈ 140 GB)
Mac Studio da 192 GB oppure 4× RTX 4090 con 96 GB (con circa 40 GB trasferiti nella RAM di sistema). Primo livello davvero valido per una chat generalista in francese.
Q3_K_M (≈ 200 GB)
Mac Studio M3 Ultra o M5 Ultra da 256 GB oppure 2× RTX 6000 Ada da 96 GB + 128 GB di RAM per l'offload. Buon compromesso tra qualità e costo.
Q4_K_M (≈ 270 GB)
Il punto ottimale in termini di qualità. Un Mac Studio Ultra da 256 GB riesce a farlo girare con un contesto breve; altrimenti 4× A6000 da 48 GB (192 GB) + offload, oppure un nodo DGX.
Q5_K_M (≈ 330 GB)
Riservato a H100 80 GB ×4, MI300X 192 GB ×2, o a un cluster. Vantaggio marginale rispetto a Q4 nella pratica.
Q8_0 (≈ 510 GB)
Solo per datacenter. A questo livello, tanto vale servire il modello con vLLM in parallelismo tensoriale su 8× H100.
→
La scelta predefinita consigliata
Se il tuo obiettivo è un uso locale serio, punta a Q4_K_M e accetta di investire nella capacità totale di VRAM. Le quantizzazioni inferiori a Q3 mostrano regressioni visibili appena si va oltre le conversazioni banali — tipicamente nella generazione di codice lungo o nel rispetto di istruzioni con più vincoli.

#Installazione

Tre opzioni in base al tuo hardware. Ollama per la semplicità, llama.cpp per il controllo, vLLM per servire più utenti.

#Via 1: Ollama (Mac Studio Ultra)

Su Mac Studio Ultra, Ollama gestisce automaticamente la memoria unificata. Il demone è in ascolto su http://localhost:11434.

Terminale
# Vérifier qu'Ollama est à jour
ollama --version

# Télécharger la variante adaptée
ollama pull qwen3.7-max:q3_K_M

# Premier lancement (chargement long ~3 min)
ollama run qwen3.7-max:q3_K_M

Durante il caricamento, controlla ollama ps in un altro terminale. La colonna SIZE deve mostrare la dimensione attesa (≈ 200 GB per Q3_K_M).

#Percorso 2: llama.cpp (multi-GPU NVIDIA)

Scarica il GGUF Q4_K_M da Hugging Face (cerca: Qwen3.7-Max-Instruct-GGUF, modelli pubblicati dal team Qwen o da bartowski). Il download pesa 270 GB: tienine conto per la banda disponibile.

Server llama.cpp tensor-parallel
./llama-server \
  -m ./models/Qwen3.7-Max-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  --tensor-split 24,24,24,24 \
  --main-gpu 0 \
  --flash-attn \
  --cache-type-k q8_0 --cache-type-v q8_0
--tensor-split 24,24,24,24
Distribuisce i livelli su 4 GPU in parti uguali. Adattare ai GB disponibili per scheda (es.: 24,24 per 2 GPU).
--cache-type-k q8_0
Quantizza la cache KV, libera circa il 30% della VRAM, perdita di qualità trascurabile.
--flash-attn
Indispensabile oltre gli 8 k di contesto con questo numero di parametri.
-c 16384
Un contesto di 16 k è un buon compromesso. Passare a 32 k richiede diversi GB aggiuntivi su un modello 480B.

#Via 3: vLLM (produzione, multiutente)

Se metti il modello a disposizione di un team, vLLM con parallelismo tensoriale sfrutta meglio la banda PCIe e offre un throughput batch nettamente superiore.

Avvio vLLM
vllm serve Qwen/Qwen3.7-Max-Instruct-AWQ \
  --tensor-parallel-size 4 \
  --max-model-len 32768 \
  --quantization awq \
  --gpu-memory-utilization 0.92 \
  --enable-expert-parallel
i
AWQ vs GGUF
vLLM preferisce le quantizzazioni AWQ o GPTQ, ottimizzate per le GPU NVIDIA. GGUF resta la scelta migliore su CPU/Mac e in configurazioni eterogenee. Su una singola macchina esclusivamente NVIDIA, AWQ a 4 bit con vLLM supera GGUF Q4_K_M con llama.cpp nel throughput in batch (da ×2 a ×3 a seconda del carico).

#Distribuzione multi-GPU

Tre strategie diverse in base al tuo hardware e al tuo carico di lavoro.

  1. 01
    Layer split (modalità predefinita in llama.cpp)
    Ogni GPU gestisce un blocco contiguo di livelli. Semplice, funziona con GPU eterogenee (es.: 3090 + 4090). Collo di bottiglia: una sola GPU esegue i calcoli alla volta, le altre attendono. Velocità limitata dalla scheda più lenta.
  2. 02
    Parallelismo tensoriale (vLLM, versioni recenti di llama.cpp)
    Ogni layer è diviso orizzontalmente tra tutte le GPU, che eseguono i calcoli in parallelo. Richiede una larghezza di banda PCIe adeguata (Gen4 x16 o NVLink) e schede omogenee. Throughput da 1,8× a 2,5× superiore rispetto al layer split su 4 GPU.
  3. 03
    Expert parallel (specifico per i MoE)
    Distribuisce gli esperti tra le GPU. Per Qwen3.7 Max con 128 esperti su 4 schede, ogni GPU gestisce 32 esperti. Riduce la VRAM per scheda, ma ogni token attiva esperti su più GPU: una buona opzione se si dispone di PCIe Gen5 o NVLink.
→
PCIe conta davvero qui
Con un MoE di queste dimensioni, l'instradamento dei token tra gli esperti genera un traffico inter-GPU continuo. Una scheda madre consumer con PCIe Gen4 x4 sul secondo slot ridurrà il throughput del 30-50 %. Se realizzi un sistema con quattro GPU, scegli uno chassis ThreadRipper o Xeon con tutte le lane disponibili.
Verificare l'allocazione multi-GPU
# Sous Linux, surveille la conso VRAM en direct
watch -n 1 nvidia-smi

# Avec llama.cpp, vérifie que tous les GPU travaillent
nvidia-smi dmon -s u -c 30

#Velocità di generazione attesa in token/s

Misure effettuate in Q4_K_M (salvo diversa indicazione), contesto di 4 k, prompt breve, generazione di 512 token, batch 1. Il throughput diminuisce logaritmicamente con la lunghezza del contesto — la fase di valutazione del prompt esplode oltre i 16 k token.

Mac Studio M3 Ultra o M5 Ultra 256 GB (Q3_K_M)
≈ 18–24 tok/s in generazione. Le prestazioni nella fase di valutazione del prompt restano discrete (~600 tok/s). Eccellente per l'uso continuativo da parte di un solo utente, silenzioso 24/7.
Mac Studio M2 Ultra 192 GB (IQ2_XS)
≈ 22–28 tok/s, qualità degradata. Accettabile per test, non per produzione.
2× RTX 6000 Ada 48 GB (Q3_K_M, layer split)
≈ 28–35 tok/s. Buona opzione per workstation pro.
4× RTX 4090 24 GB (Q4_K_M, tensor-parallel llama.cpp)
≈ 35–45 tok/s in chat, 80–120 tok/s con batch=4. Il miglior rapporto prestazioni/€ in una configurazione fai-da-te.
4× RTX 4090 (vLLM AWQ tensor-parallel)
≈ 50–65 tok/s in chat con un solo utente, fino a 300+ tok/s aggregati con batch di grandi dimensioni. Preferibile per fornire il servizio a un team.
2× H100 80 GB (Q4_K_M, NVLink)
≈ 75–90 tok/s in chat. Mercato professionale, ma NVLink cambia tutto per questo profilo di modello.
i
Cosa non mostrano questi numeri
Su un MoE di queste dimensioni, il time-to-first-token con un contesto di 32 k può arrivare a 8–15 secondi. Per il RAG o i prompt lunghi, memorizza nella cache i tuoi prefissi (opzione --prompt-cache di llama.cpp o prefix caching di vLLM): è questo che rende l'esperienza sopportabile.

#Modelli di frontiera open-weight vs cloud

A parità di prestazioni, cosa giustifica eseguire Qwen3.7 Max localmente piuttosto che pagare un'API?

Confidenzialità reale
I prompt non lasciano mai la tua rete. Per gli avvocati, i servizi medici e i team delle risorse umane, questo non è negoziabile — e nessuna politica cloud di "zero retention" equivale a un air-gap.
Costo marginale nullo
Una volta ammortizzato l'investimento hardware, ogni token è gratuito. Con carichi di lavoro intensivi (generazione sintetica di dataset, batch di analisi), il ritorno sull'investimento supera quello del cloud in pochi mesi.
Personalizzazione profonda
Puoi eseguire il fine-tuning, modificare il prompt di sistema predefinito, collegare strumenti sviluppati internamente, intercettare i logprobs. Nessuna API dei modelli di frontiera offre queste possibilità.
Indipendenza dal fornitore
Nessuna quota, nessun limite alla frequenza delle richieste, nessun modello che scompare al prossimo aggiornamento dei prezzi. Il modello rimane sul tuo disco.
Latenza prevedibile
Nessuna congestione del server, nessun "the model is overloaded" nel bel mezzo di una demo per un cliente.
!
Dove il cloud resta in vantaggio
Per un uso interattivo occasionale a latenza molto bassa o per gestire centinaia di richieste al secondo, il cloud rimane più economico. Qwen3.7 Max in locale eccelle con un carico batch sostenuto, non con un picco occasionale — è la stessa logica del confronto tra server on-prem e SaaS.

#Risoluzione dei problemi

OOM durante il caricamento su una configurazione con quattro 4090
Verificare che la somma dei valori di --tensor-split corrisponda alla VRAM realmente disponibile (non alla VRAM visualizzata). Lasciare 1-2 GB di margine per scheda per l'overhead CUDA.
Velocità inferiore a 10 tok/s
Molto probabilmente la GPU sta utilizzando anche la RAM di sistema perché la VRAM non basta. nvidia-smi mostrerà il 100% della VRAM utilizzata e una scheda che non supera il 30% di utilizzo. Riduci la quantizzazione o aggiungi VRAM.
Time-to-first-token > 30s
Fase di valutazione del prompt saturata. Attiva --flash-attn, quantizza la cache KV e riduci num_ctx al minimo necessario. Se possibile, raggruppa le tue richieste in batch.
Qualità in caduta libera rispetto ai benchmark
Verifica che tu stia effettivamente usando la variante Instruct (e non Base), che il template di chat sia applicato (Ollama lo fa, llama.cpp non lo fa senza --chat-template) e che la quantizzazione non sia scesa sotto Q3.
Crash dopo poche ore
Spesso la causa è termica: 4 GPU al 100% riscaldano il case. Verifica le temperature di giunzione, regola le curve delle ventole e applica un undervolt da -50 mV a -100 mV. Vedere la guida sulla gestione termica.
Lentezza estrema al primissimo prompt
Il modello viene caricato dall'SSD — considera da 2 a 5 minuti per 270 GB. I prompt successivi sono istantanei finché il modello rimane in memoria.

#Per approfondire

Qwen3.7 Max richiede un impegno hardware considerevole. Ecco alcune guide correlate per dimensionare correttamente la configurazione prima dell'acquisto:

Configurazione multi-GPU con llama.cpp
La guida pratica per distribuire un modello di grandi dimensioni su 2 o 4 GPU NVIDIA, con le insidie di PCIe e NVLink.
Quale LLM su Mac Studio (M2/M3/M4 Ultra, 64–512 GB) ?
Confrontare ciò che la memoria unificata Apple permette rispetto a una configurazione multi-GPU NVIDIA per un modello di questo livello.
Mettere vLLM in produzione
Se Qwen3.7 Max deve servire più utenti contemporaneamente, vLLM con parallelo tensoriale è la soluzione giusta.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.