Qwen3.7 Max in locale: il top dei modelli open-weights ospitabili su infrastruttura propria
Qwen3.7 Max è il modello open-weight più grande di Alibaba finora: un MoE di frontiera progettato per competere con i modelli proprietari di alto livello. Farlo funzionare localmente su qwen3.7 max local non è un'operazione per tutti — serve hardware solido e un po' di metodo. Questa guida mostra le quantificazioni che funzionano davvero su 24 a 48 GB per scheda, come distribuire il modello su più GPU, il throughput che si può aspettare e i casi in cui supera in modo significativo le API cloud.
#Perché Qwen3.7 Max
Nella quasi totalità dei benchmark pubblici di fine 2026, Qwen3.7 Max occupa il primo posto tra i modelli open-weight: ragionamento in più passaggi, codice, matematica, capacità di seguire istruzioni lunghe in cinese e in inglese — e un livello di francese che non ha più nulla di imbarazzante. A questo livello, non c'è più alcun motivo tecnico per inviare i propri prompt a un provider cloud, salvo la necessità di un throughput molto elevato.
Il modello è distribuito sotto licenza Tongyi Qianwen (Apache-2.0 per la maggior parte dei pesi). Le varianti Instruct, Coder e Thinking sono pubblicate su Hugging Face e rese disponibili anche su ollama.com/library. Per chi possiede una workstation IA ben equipaggiata, oggi è il modello open-weight più credibile nel confronto con GPT-5 Mini o Claude Sonnet 4.
#Il modello in sintesi
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Architettura
- Mixture-of-Experts. Circa 480 miliardi di parametri totali, ~46B attivi per token (il routing seleziona 8 esperti su 128).
- Contesto nativo
- 256 k token tramite YaRN, 1 M token con un'estensione sperimentale. La stragrande maggioranza degli utilizzi resta sotto i 32 k.
- Tokenizer
- BPE multilingue in stile Tiktoken, rapporto token/parola contenuto in francese (≈ 1,4 token/parola — paragonabile a GPT-4).
- Varianti
- Qwen3.7-Max-Instruct (chat generale), -Coder (programmazione), -Thinking (ragionamento esplicito tipo DeepSeek R1).
- Licenza
- Licenza Apache-2.0 sui pesi principali. Uso commerciale autorizzato, redistribuzione permessa, nessuna clausola anti-concorrenza stringente.
#Requisiti hardware
- VRAM totale (Q4_K_M)
- Prevedere ≈ 270 GB per il modello + cache KV. È l'obiettivo a cui si punta con una configurazione multi-GPU o un Mac Studio Ultra da 256 GB.
- Workstation minima utilizzabile
- Mac Studio M2 Ultra da 192 GB (Q3_K_M, contesto 8 k) — l'unica configurazione su una sola macchina di fascia consumer che ce la fa senza due GPU.
- Workstation con un buon margine di capacità
- 4× RTX 4090 da 24 GB (96 GB totali, Q2_K + offload), o 2× RTX 6000 Ada da 48 GB, o Mac Studio M3 Ultra o M5 Ultra da 256 GB per un Q4_K_M completo.
- RAM di sistema
- Almeno 128 GB se prevedi di trasferire gli esperti nella RAM di sistema. 256 GB consigliati se carichi il modello solo in RAM (molto lento ma funzionante).
- Disco
- ≈ 270 GB per Q4_K_M, ≈ 1 TB per FP16. SSD NVMe Gen4 obbligatorio — altrimenti il caricamento iniziale dura 20+ minuti.
- Runtime
- Build di llama.cpp successiva a ottobre 2026 (supporto al parallelismo tensoriale MoE), vLLM ≥ 0.7 oppure Ollama ≥ 0.6 (se la variante GGUF è pubblicata).
#Quantizzazioni che rientrano in 24–48 GB
La domanda concreta è: cosa ci sta senza mandare tutto in crisi? Gli ingombri in memoria riportati di seguito includono il modello, una cache KV per 8 k di contesto e l'overhead del runtime. Presuppongono che tu sommi la VRAM di tutte le tue schede.
- IQ1_M (≈ 110 GB)
- Rientra nella memoria di 2× 48 GB o di un Mac Studio da 128 GB. Qualità ridotta nella programmazione e nei ragionamenti lunghi — utile per sperimentare, non per l'uso in produzione.
- IQ2_XS (≈ 140 GB)
- Mac Studio da 192 GB oppure 4× RTX 4090 con 96 GB (con circa 40 GB trasferiti nella RAM di sistema). Primo livello davvero valido per una chat generalista in francese.
- Q3_K_M (≈ 200 GB)
- Mac Studio M3 Ultra o M5 Ultra da 256 GB oppure 2× RTX 6000 Ada da 96 GB + 128 GB di RAM per l'offload. Buon compromesso tra qualità e costo.
- Q4_K_M (≈ 270 GB)
- Il punto ottimale in termini di qualità. Un Mac Studio Ultra da 256 GB riesce a farlo girare con un contesto breve; altrimenti 4× A6000 da 48 GB (192 GB) + offload, oppure un nodo DGX.
- Q5_K_M (≈ 330 GB)
- Riservato a H100 80 GB ×4, MI300X 192 GB ×2, o a un cluster. Vantaggio marginale rispetto a Q4 nella pratica.
- Q8_0 (≈ 510 GB)
- Solo per datacenter. A questo livello, tanto vale servire il modello con vLLM in parallelismo tensoriale su 8× H100.
#Installazione
Tre opzioni in base al tuo hardware. Ollama per la semplicità, llama.cpp per il controllo, vLLM per servire più utenti.
#Via 1: Ollama (Mac Studio Ultra)
Su Mac Studio Ultra, Ollama gestisce automaticamente la memoria unificata. Il demone è in ascolto su http://localhost:11434.
Durante il caricamento, controlla ollama ps in un altro terminale. La colonna SIZE deve mostrare la dimensione attesa (≈ 200 GB per Q3_K_M).
#Percorso 2: llama.cpp (multi-GPU NVIDIA)
Scarica il GGUF Q4_K_M da Hugging Face (cerca: Qwen3.7-Max-Instruct-GGUF, modelli pubblicati dal team Qwen o da bartowski). Il download pesa 270 GB: tienine conto per la banda disponibile.
- --tensor-split 24,24,24,24
- Distribuisce i livelli su 4 GPU in parti uguali. Adattare ai GB disponibili per scheda (es.: 24,24 per 2 GPU).
- --cache-type-k q8_0
- Quantizza la cache KV, libera circa il 30% della VRAM, perdita di qualità trascurabile.
- --flash-attn
- Indispensabile oltre gli 8 k di contesto con questo numero di parametri.
- -c 16384
- Un contesto di 16 k è un buon compromesso. Passare a 32 k richiede diversi GB aggiuntivi su un modello 480B.
#Via 3: vLLM (produzione, multiutente)
Se metti il modello a disposizione di un team, vLLM con parallelismo tensoriale sfrutta meglio la banda PCIe e offre un throughput batch nettamente superiore.
#Distribuzione multi-GPU
Tre strategie diverse in base al tuo hardware e al tuo carico di lavoro.
- 01Layer split (modalità predefinita in llama.cpp)Ogni GPU gestisce un blocco contiguo di livelli. Semplice, funziona con GPU eterogenee (es.: 3090 + 4090). Collo di bottiglia: una sola GPU esegue i calcoli alla volta, le altre attendono. Velocità limitata dalla scheda più lenta.
- 02Parallelismo tensoriale (vLLM, versioni recenti di llama.cpp)Ogni layer è diviso orizzontalmente tra tutte le GPU, che eseguono i calcoli in parallelo. Richiede una larghezza di banda PCIe adeguata (Gen4 x16 o NVLink) e schede omogenee. Throughput da 1,8× a 2,5× superiore rispetto al layer split su 4 GPU.
- 03Expert parallel (specifico per i MoE)Distribuisce gli esperti tra le GPU. Per Qwen3.7 Max con 128 esperti su 4 schede, ogni GPU gestisce 32 esperti. Riduce la VRAM per scheda, ma ogni token attiva esperti su più GPU: una buona opzione se si dispone di PCIe Gen5 o NVLink.
#Velocità di generazione attesa in token/s
Misure effettuate in Q4_K_M (salvo diversa indicazione), contesto di 4 k, prompt breve, generazione di 512 token, batch 1. Il throughput diminuisce logaritmicamente con la lunghezza del contesto — la fase di valutazione del prompt esplode oltre i 16 k token.
- Mac Studio M3 Ultra o M5 Ultra 256 GB (Q3_K_M)
- ≈ 18–24 tok/s in generazione. Le prestazioni nella fase di valutazione del prompt restano discrete (~600 tok/s). Eccellente per l'uso continuativo da parte di un solo utente, silenzioso 24/7.
- Mac Studio M2 Ultra 192 GB (IQ2_XS)
- ≈ 22–28 tok/s, qualità degradata. Accettabile per test, non per produzione.
- 2× RTX 6000 Ada 48 GB (Q3_K_M, layer split)
- ≈ 28–35 tok/s. Buona opzione per workstation pro.
- 4× RTX 4090 24 GB (Q4_K_M, tensor-parallel llama.cpp)
- ≈ 35–45 tok/s in chat, 80–120 tok/s con batch=4. Il miglior rapporto prestazioni/€ in una configurazione fai-da-te.
- 4× RTX 4090 (vLLM AWQ tensor-parallel)
- ≈ 50–65 tok/s in chat con un solo utente, fino a 300+ tok/s aggregati con batch di grandi dimensioni. Preferibile per fornire il servizio a un team.
- 2× H100 80 GB (Q4_K_M, NVLink)
- ≈ 75–90 tok/s in chat. Mercato professionale, ma NVLink cambia tutto per questo profilo di modello.
#Modelli di frontiera open-weight vs cloud
A parità di prestazioni, cosa giustifica eseguire Qwen3.7 Max localmente piuttosto che pagare un'API?
- Confidenzialità reale
- I prompt non lasciano mai la tua rete. Per gli avvocati, i servizi medici e i team delle risorse umane, questo non è negoziabile — e nessuna politica cloud di "zero retention" equivale a un air-gap.
- Costo marginale nullo
- Una volta ammortizzato l'investimento hardware, ogni token è gratuito. Con carichi di lavoro intensivi (generazione sintetica di dataset, batch di analisi), il ritorno sull'investimento supera quello del cloud in pochi mesi.
- Personalizzazione profonda
- Puoi eseguire il fine-tuning, modificare il prompt di sistema predefinito, collegare strumenti sviluppati internamente, intercettare i logprobs. Nessuna API dei modelli di frontiera offre queste possibilità.
- Indipendenza dal fornitore
- Nessuna quota, nessun limite alla frequenza delle richieste, nessun modello che scompare al prossimo aggiornamento dei prezzi. Il modello rimane sul tuo disco.
- Latenza prevedibile
- Nessuna congestione del server, nessun "the model is overloaded" nel bel mezzo di una demo per un cliente.
#Risoluzione dei problemi
- OOM durante il caricamento su una configurazione con quattro 4090
- Verificare che la somma dei valori di --tensor-split corrisponda alla VRAM realmente disponibile (non alla VRAM visualizzata). Lasciare 1-2 GB di margine per scheda per l'overhead CUDA.
- Velocità inferiore a 10 tok/s
- Molto probabilmente la GPU sta utilizzando anche la RAM di sistema perché la VRAM non basta. nvidia-smi mostrerà il 100% della VRAM utilizzata e una scheda che non supera il 30% di utilizzo. Riduci la quantizzazione o aggiungi VRAM.
- Time-to-first-token > 30s
- Fase di valutazione del prompt saturata. Attiva --flash-attn, quantizza la cache KV e riduci num_ctx al minimo necessario. Se possibile, raggruppa le tue richieste in batch.
- Qualità in caduta libera rispetto ai benchmark
- Verifica che tu stia effettivamente usando la variante Instruct (e non Base), che il template di chat sia applicato (Ollama lo fa, llama.cpp non lo fa senza --chat-template) e che la quantizzazione non sia scesa sotto Q3.
- Crash dopo poche ore
- Spesso la causa è termica: 4 GPU al 100% riscaldano il case. Verifica le temperature di giunzione, regola le curve delle ventole e applica un undervolt da -50 mV a -100 mV. Vedere la guida sulla gestione termica.
- Lentezza estrema al primissimo prompt
- Il modello viene caricato dall'SSD — considera da 2 a 5 minuti per 270 GB. I prompt successivi sono istantanei finché il modello rimane in memoria.
#Per approfondire
Qwen3.7 Max richiede un impegno hardware considerevole. Ecco alcune guide correlate per dimensionare correttamente la configurazione prima dell'acquisto:
- Configurazione multi-GPU con llama.cpp
- La guida pratica per distribuire un modello di grandi dimensioni su 2 o 4 GPU NVIDIA, con le insidie di PCIe e NVLink.
- Quale LLM su Mac Studio (M2/M3/M4 Ultra, 64–512 GB) ?
- Confrontare ciò che la memoria unificata Apple permette rispetto a una configurazione multi-GPU NVIDIA per un modello di questo livello.
- Mettere vLLM in produzione
- Se Qwen3.7 Max deve servire più utenti contemporaneamente, vLLM con parallelo tensoriale è la soluzione giusta.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.