Spiegazione di MoE: perché un 30B-A3B funziona come un piccolo modello
Dal 2025, la maggior parte dei principali modelli open-weight rilasciati ha un punto in comune: si tratta di Mixture of Experts, o MoE. Si vedono nomi come Qwen3 30B-A3B, gpt-oss 120B o Llama 4 Scout 17B-A2B, con questa notazione a due numeri che incuriosisce. L'idea di base è semplice: un modello MoE contiene molti parametri, ma ne attiva solo una piccola frazione per ogni token. Di conseguenza, un modello «da 30 miliardi» può funzionare alla velocità di un modello da 3 miliardi. Questa guida spiega il meccanismo, decodifica la notazione e descrive in dettaglio l'impatto reale sulla tua VRAM e sulla velocità di generazione.
#Il problema che il MoE risolve
Un modello di linguaggio classico viene detto «denso»: per generare ogni parola, fa passare il tuo testo attraverso tutti i suoi parametri. Un modello denso da 32B utilizza i suoi 32 miliardi di parametri a ogni token. È questo che lo rende potente, ma anche lento ed esigente in termini di risorse: più parametri ci sono, più calcolo e memoria servono, senza possibilità di evitarlo.
Il dilemma dell'IA locale è questo. Vogliamo le conoscenze e la finezza di un modello grande, ma la velocità e il basso consumo di risorse di uno piccolo. Su una scheda destinata al mercato consumer, un modello denso da 70B è fuori portata oppure esasperatamente lento. Il Mixture of Experts supera questo compromesso separando due aspetti che credevamo legati: la dimensione del modello e il costo di ogni token.
#Il principio: esperti attivati su richiesta
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
In un modello Mixture of Experts, i grandi livelli di calcolo non sono più un blocco unico, ma un insieme di sottoreti chiamate «esperti». Un modello può contenerne 64, 128, talvolta di più. Per ogni token elaborato, un piccolo componente di smistamento — il «router» — esamina il contesto e sceglie soltanto 2, 4 o 8 esperti da attivare. Gli altri esperti non eseguono alcun calcolo per quel token.
Contrariamente a ciò che il termine suggerisce, questi esperti non sono tematici: non c'è un 'esperto in francese' o un 'esperto in codice'. Il router viene addestrato contemporaneamente al modello e distribuisce il lavoro secondo pattern statistici che nessuno pilota manualmente. Da un token all'altro, la selezione cambia. Su una frase intera, la quasi totalità degli esperti finisce per essere utilizzata, ma mai tutti contemporaneamente.
- Esperti
- Sottoreti specializzate, tutte presenti in memoria, ma solo una minoranza lavora per ogni token.
- Router (gating)
- Il componente leggero che, token per token, decide quali esperti attivare.
- Esperti attivi
- Il numero di esperti attivati per token, spesso da 2 a 8. È questo numero che determina la velocità.
- Parametri attivi
- Totale dei parametri effettivamente utilizzati per token — la frazione che conta per il calcolo.
#Decodifica la notazione 30B-A3B
La notazione che confonde i principianti è in realtà molto chiara una volta che si ha la chiave. Prendi Qwen3 30B-A3B: il primo numero è il totale dei parametri del modello, il secondo (dopo la «A», che sta per Active) è il numero di parametri attivi per token.
- 30B
- Il modello contiene 30 miliardi di parametri in totale. È questo che determina la quantità di memoria necessaria per caricarlo.
- A3B
- Solo circa 3 miliardi di parametri sono attivi per ogni token. Questo determina la velocità di generazione.
In altre parole, 30B-A3B si legge « 30 miliardi in riserva, 3 miliardi in uso ». Il modello ha la ricchezza di conoscenze di un 30B, ma genera circa alla velocità di un 3B denso. Questa stessa logica si applica a tutte le altre uscite recenti.
- Qwen3 30B-A3B
- 30 miliardi in totale, 3 miliardi attivi — il MoE per il grande pubblico per eccellenza.
- Llama 4 Scout 17B-A2B
- 17 miliardi in totale, circa 2 miliardi attivi per token, con in più il supporto multimodale.
- gpt-oss 120B
- 120 miliardi in totale, ma solo circa 5 miliardi attivi — da qui la velocità sorprendente rispetto alle sue dimensioni.
- DeepSeek V3.2 671B-A37B
- 671 miliardi in riserva, 37 miliardi attivi: un gigante che, per token, «costa» solo quanto un modello medio.
#VRAM: ciò che cambia veramente
È il punto più frainteso, quindi siamo chiari. Tutti gli esperti di un MoE devono essere caricati in memoria, perché il router può richiamare uno qualsiasi di essi per il token successivo. La VRAM richiesta dipende quindi dal numero totale di parametri, non dal numero di parametri attivi. Un 30B-A3B richiede un dimensionamento della memoria come un modello denso da 30B.
- Qwen3 30B-A3B in Q4_K_M
- ≈ 18-19 GB di VRAM, come un modello denso da 32B. Richiede quindi una RTX 4090 da 24 GB, oppure, su schede con meno memoria, viene caricato in parte nella RAM di sistema.
- Llama 4 Scout 17B-A2B in Q4
- ≈ 10-11 GB, entro le possibilità di una RTX 4070 12 GB o di una 3060 12 GB.
- gpt-oss 120B
- Diverse decine di GB: riservato alle configurazioni potenti o all'offload su RAM/SSD.
Il vantaggio dei MoE in locale non è quindi la memoria, ma il rapporto qualità/velocità a parità di VRAM. Dove un modello denso da 30B fatica sulla tua scheda, un MoE 30B-A3B occupa lo stesso spazio pur generando molto più velocemente. E poiché gli esperti inattivi non vengono utilizzati per ogni token, i MoE tollerano spesso bene l'offload di una parte dei pesi nella RAM: ciò che rimane sulla GPU viene utilizzato in via prioritaria.
#Velocità: perché è veloce
La velocità di generazione di un LLM dipende soprattutto dal numero di parametri utilizzati per ogni token. Poiché un MoE ne attiva solo una piccola frazione, la quantità di calcoli per token si riduce drasticamente. In pratica, un 30B-A3B genera token a un ritmo simile a quello di un modello denso da 3B, pur rispondendo con la profondità di un 30B.
È proprio questo che spiega la diffusione dei MoE sulle configurazioni modeste: si ottiene la qualità di un grande modello senza pagarne il prezzo in termini di lentezza. Il prezzo da pagare si trova altrove — nella memoria, come abbiamo visto, e in una maggiore occupazione di spazio su disco al momento del download, perché bisogna memorizzare tutti gli esperti.
- Ciò che accelera
- Pochi parametri attivi per token → meno calcolo → più token al secondo.
- Cosa non cambia
- La VRAM e la dimensione del file, che dipendono dal numero totale di parametri.
- Il guadagno netto
- A parità di memoria, un MoE offre più conoscenze con una velocità paragonabile a quella di un modello denso molto più piccolo.
#I limiti da conoscere
Il MoE non è magico e non rende obsoleti i modelli densi. A parità di numero di parametri attivi, un modello denso rimane generalmente un gradino sopra per finezza di ragionamento: un 30B-A3B è eccellente, ma un vero modello denso da 30B che attiverebbe tutti i suoi 30 miliardi a ogni token sarebbe più capace — al prezzo di una lentezza proibitiva in locale.
- Memoria non ridotta
- Serve abbastanza VRAM per l'intero modello. Un MoE non fa entrare un modello grande in una scheda piccola.
- Qualità per token attiva
- A parità di parametri attivi, un modello denso ben addestrato mantiene spesso un vantaggio nei compiti di ragionamento più sofisticati.
- Download più pesante
- Tutti gli esperti sono memorizzati: la dimensione del file GGUF corrisponde al totale dei parametri, non a quelli attivi.
- Sensibilità alla quantizzazione
- Il router e alcuni esperti tollerano male una quantizzazione troppo aggressiva; rimani su Q4_K_M o al di sopra.
#I modelli MoE di riferimento da provare in locale
Ecco i modelli Mixture of Experts più sensati da testare localmente nel 2026, dal più accessibile al più esigente.
- Qwen3 30B-A3B
- Il miglior punto di partenza. Qualità solida sia nelle attività generaliste sia nella programmazione, velocità notevole, circa 18 GB in Q4. Il riferimento per scoprire il MoE.
- Llama 4 Scout 17B-A2B
- MoE multimodale (testo + immagine) con contesto lungo, che richiede meno VRAM. Ideale se hai una scheda da 12 GB.
- gpt-oss 120B
- Il modello open-weight di OpenAI, con solo circa 5B di parametri attivi: sorprendentemente veloce per le sue dimensioni, ma richiede una configurazione potente.
- DeepSeek V3.2 671B-A37B
- Il mostro. Riservato alle configurazioni con molta RAM e un offload aggressivo, per chi è curioso di provare i modelli di fascia più alta.
Se sei agli inizi, comincia con Qwen3 30B-A3B: è il MoE che mostra meglio i vantaggi dell'architettura su una sola scheda di fascia consumer.
#Prova un MoE in 3 minuti
Se Ollama è già installato ed è in ascolto sulla sua porta predefinita, bastano due comandi per percepire la differenza tra un modello MoE e uno denso.
- 01Scaricare e avviare un MoEScarica Qwen3 30B-A3B e inizia subito a conversare con il modello. Il primo avvio scarica il modello (prevedi diversi GB).
- 02Osservare la velocitàFai una domanda un po' lunga e annota la velocità di generazione. Nonostante i suoi 30 miliardi di parametri, risponde subito, alla velocità di un modello piccolo.
- 03Confrontare con un modello densoAvvia un modello denso di dimensioni simili e poni la stessa domanda. Il MoE dovrebbe generare nettamente più velocemente, a parità di VRAM.
#Per approfondire
Il MoE si comprende meglio collegandolo alle altre nozioni di base dell'IA locale. Queste guide approfondiscono direttamente quanto trattato in questa guida:
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Il MoE è sensibile a una quantizzazione eccessivamente aggressiva: questo manuale aiuta a trovare il giusto equilibrio tra qualità e memoria.
- Installare Ollama: Windows, macOS e Linux
- Per configurare il daemon locale sulla porta 11434 prima di scaricare il tuo primo MoE.
- Llama 4 Scout in locale: installazione e primi test con Ollama
- Un MoE multimodale spiegato passo dopo passo, per vedere in azione la teoria di questo manuale.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.