Principiante 8 minConcetti

Spiegazione di MoE: perché un 30B-A3B funziona come un piccolo modello

Dal 2025, la maggior parte dei principali modelli open-weight rilasciati ha un punto in comune: si tratta di Mixture of Experts, o MoE. Si vedono nomi come Qwen3 30B-A3B, gpt-oss 120B o Llama 4 Scout 17B-A2B, con questa notazione a due numeri che incuriosisce. L'idea di base è semplice: un modello MoE contiene molti parametri, ma ne attiva solo una piccola frazione per ogni token. Di conseguenza, un modello «da 30 miliardi» può funzionare alla velocità di un modello da 3 miliardi. Questa guida spiega il meccanismo, decodifica la notazione e descrive in dettaglio l'impatto reale sulla tua VRAM e sulla velocità di generazione.

Di Mohamed Meguedmi·Agg. 2026-08-02·Testato su Windows, macOS e Linux

#Il problema che il MoE risolve

Un modello di linguaggio classico viene detto «denso»: per generare ogni parola, fa passare il tuo testo attraverso tutti i suoi parametri. Un modello denso da 32B utilizza i suoi 32 miliardi di parametri a ogni token. È questo che lo rende potente, ma anche lento ed esigente in termini di risorse: più parametri ci sono, più calcolo e memoria servono, senza possibilità di evitarlo.

Il dilemma dell'IA locale è questo. Vogliamo le conoscenze e la finezza di un modello grande, ma la velocità e il basso consumo di risorse di uno piccolo. Su una scheda destinata al mercato consumer, un modello denso da 70B è fuori portata oppure esasperatamente lento. Il Mixture of Experts supera questo compromesso separando due aspetti che credevamo legati: la dimensione del modello e il costo di ogni token.

i
L'intuizione in una frase
Un modello denso fa lavorare tutti su ogni domanda. Un MoE sveglia solo i pochi specialisti interessati e lascia dormire gli altri.

#Il principio: esperti attivati su richiesta

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

In un modello Mixture of Experts, i grandi livelli di calcolo non sono più un blocco unico, ma un insieme di sottoreti chiamate «esperti». Un modello può contenerne 64, 128, talvolta di più. Per ogni token elaborato, un piccolo componente di smistamento — il «router» — esamina il contesto e sceglie soltanto 2, 4 o 8 esperti da attivare. Gli altri esperti non eseguono alcun calcolo per quel token.

Contrariamente a ciò che il termine suggerisce, questi esperti non sono tematici: non c'è un 'esperto in francese' o un 'esperto in codice'. Il router viene addestrato contemporaneamente al modello e distribuisce il lavoro secondo pattern statistici che nessuno pilota manualmente. Da un token all'altro, la selezione cambia. Su una frase intera, la quasi totalità degli esperti finisce per essere utilizzata, ma mai tutti contemporaneamente.

Esperti
Sottoreti specializzate, tutte presenti in memoria, ma solo una minoranza lavora per ogni token.
Router (gating)
Il componente leggero che, token per token, decide quali esperti attivare.
Esperti attivi
Il numero di esperti attivati per token, spesso da 2 a 8. È questo numero che determina la velocità.
Parametri attivi
Totale dei parametri effettivamente utilizzati per token — la frazione che conta per il calcolo.
→
Un'immagine mentale
Immagina uno studio con 128 medici. Il paziente viene accolto da un addetto allo smistamento che lo indirizza ai 4 specialisti pertinenti. Lo studio è enorme (molte conoscenze disponibili), ma ogni visita coinvolge solo 4 persone (un costo ridotto per paziente).

#Decodifica la notazione 30B-A3B

La notazione che confonde i principianti è in realtà molto chiara una volta che si ha la chiave. Prendi Qwen3 30B-A3B: il primo numero è il totale dei parametri del modello, il secondo (dopo la «A», che sta per Active) è il numero di parametri attivi per token.

30B
Il modello contiene 30 miliardi di parametri in totale. È questo che determina la quantità di memoria necessaria per caricarlo.
A3B
Solo circa 3 miliardi di parametri sono attivi per ogni token. Questo determina la velocità di generazione.

In altre parole, 30B-A3B si legge « 30 miliardi in riserva, 3 miliardi in uso ». Il modello ha la ricchezza di conoscenze di un 30B, ma genera circa alla velocità di un 3B denso. Questa stessa logica si applica a tutte le altre uscite recenti.

Qwen3 30B-A3B
30 miliardi in totale, 3 miliardi attivi — il MoE per il grande pubblico per eccellenza.
Llama 4 Scout 17B-A2B
17 miliardi in totale, circa 2 miliardi attivi per token, con in più il supporto multimodale.
gpt-oss 120B
120 miliardi in totale, ma solo circa 5 miliardi attivi — da qui la velocità sorprendente rispetto alle sue dimensioni.
DeepSeek V3.2 671B-A37B
671 miliardi in riserva, 37 miliardi attivi: un gigante che, per token, «costa» solo quanto un modello medio.
!
La trappola nell'interpretazione
La seconda cifra non riduce la memoria: un 30B-A3B occupa lo spazio di un 30B, non di un 3B. Il « A3B » accelera il calcolo, non comprime il modello. È la confusione n°1 tra i principianti.

#VRAM: ciò che cambia veramente

È il punto più frainteso, quindi siamo chiari. Tutti gli esperti di un MoE devono essere caricati in memoria, perché il router può richiamare uno qualsiasi di essi per il token successivo. La VRAM richiesta dipende quindi dal numero totale di parametri, non dal numero di parametri attivi. Un 30B-A3B richiede un dimensionamento della memoria come un modello denso da 30B.

Qwen3 30B-A3B in Q4_K_M
≈ 18-19 GB di VRAM, come un modello denso da 32B. Richiede quindi una RTX 4090 da 24 GB, oppure, su schede con meno memoria, viene caricato in parte nella RAM di sistema.
Llama 4 Scout 17B-A2B in Q4
≈ 10-11 GB, entro le possibilità di una RTX 4070 12 GB o di una 3060 12 GB.
gpt-oss 120B
Diverse decine di GB: riservato alle configurazioni potenti o all'offload su RAM/SSD.

Il vantaggio dei MoE in locale non è quindi la memoria, ma il rapporto qualità/velocità a parità di VRAM. Dove un modello denso da 30B fatica sulla tua scheda, un MoE 30B-A3B occupa lo stesso spazio pur generando molto più velocemente. E poiché gli esperti inattivi non vengono utilizzati per ogni token, i MoE tollerano spesso bene l'offload di una parte dei pesi nella RAM: ciò che rimane sulla GPU viene utilizzato in via prioritaria.

i
Indicazione della VRAM in Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Per un MoE, applica questi riferimenti al primo numero (il totale), mai al numero attivo.

#Velocità: perché è veloce

La velocità di generazione di un LLM dipende soprattutto dal numero di parametri utilizzati per ogni token. Poiché un MoE ne attiva solo una piccola frazione, la quantità di calcoli per token si riduce drasticamente. In pratica, un 30B-A3B genera token a un ritmo simile a quello di un modello denso da 3B, pur rispondendo con la profondità di un 30B.

È proprio questo che spiega la diffusione dei MoE sulle configurazioni modeste: si ottiene la qualità di un grande modello senza pagarne il prezzo in termini di lentezza. Il prezzo da pagare si trova altrove — nella memoria, come abbiamo visto, e in una maggiore occupazione di spazio su disco al momento del download, perché bisogna memorizzare tutti gli esperti.

Ciò che accelera
Pochi parametri attivi per token → meno calcolo → più token al secondo.
Cosa non cambia
La VRAM e la dimensione del file, che dipendono dal numero totale di parametri.
Il guadagno netto
A parità di memoria, un MoE offre più conoscenze con una velocità paragonabile a quella di un modello denso molto più piccolo.

#I limiti da conoscere

Il MoE non è magico e non rende obsoleti i modelli densi. A parità di numero di parametri attivi, un modello denso rimane generalmente un gradino sopra per finezza di ragionamento: un 30B-A3B è eccellente, ma un vero modello denso da 30B che attiverebbe tutti i suoi 30 miliardi a ogni token sarebbe più capace — al prezzo di una lentezza proibitiva in locale.

Memoria non ridotta
Serve abbastanza VRAM per l'intero modello. Un MoE non fa entrare un modello grande in una scheda piccola.
Qualità per token attiva
A parità di parametri attivi, un modello denso ben addestrato mantiene spesso un vantaggio nei compiti di ragionamento più sofisticati.
Download più pesante
Tutti gli esperti sono memorizzati: la dimensione del file GGUF corrisponde al totale dei parametri, non a quelli attivi.
Sensibilità alla quantizzazione
Il router e alcuni esperti tollerano male una quantizzazione troppo aggressiva; rimani su Q4_K_M o al di sopra.
→
Come scegliere in pratica
Poca VRAM e bisogno di velocità con un buon bagaglio di conoscenze? Un MoE eccelle. La priorità è un ragionamento più raffinato, con abbondante VRAM a disposizione? Un modello denso con un numero equivalente di parametri attivi può essere una scelta più conveniente.

#I modelli MoE di riferimento da provare in locale

Ecco i modelli Mixture of Experts più sensati da testare localmente nel 2026, dal più accessibile al più esigente.

Qwen3 30B-A3B
Il miglior punto di partenza. Qualità solida sia nelle attività generaliste sia nella programmazione, velocità notevole, circa 18 GB in Q4. Il riferimento per scoprire il MoE.
Llama 4 Scout 17B-A2B
MoE multimodale (testo + immagine) con contesto lungo, che richiede meno VRAM. Ideale se hai una scheda da 12 GB.
gpt-oss 120B
Il modello open-weight di OpenAI, con solo circa 5B di parametri attivi: sorprendentemente veloce per le sue dimensioni, ma richiede una configurazione potente.
DeepSeek V3.2 671B-A37B
Il mostro. Riservato alle configurazioni con molta RAM e un offload aggressivo, per chi è curioso di provare i modelli di fascia più alta.

Se sei agli inizi, comincia con Qwen3 30B-A3B: è il MoE che mostra meglio i vantaggi dell'architettura su una sola scheda di fascia consumer.

#Prova un MoE in 3 minuti

Se Ollama è già installato ed è in ascolto sulla sua porta predefinita, bastano due comandi per percepire la differenza tra un modello MoE e uno denso.

  1. 01
    Scaricare e avviare un MoE
    Scarica Qwen3 30B-A3B e inizia subito a conversare con il modello. Il primo avvio scarica il modello (prevedi diversi GB).
  2. 02
    Osservare la velocità
    Fai una domanda un po' lunga e annota la velocità di generazione. Nonostante i suoi 30 miliardi di parametri, risponde subito, alla velocità di un modello piccolo.
  3. 03
    Confrontare con un modello denso
    Avvia un modello denso di dimensioni simili e poni la stessa domanda. Il MoE dovrebbe generare nettamente più velocemente, a parità di VRAM.
Terminale
# Lancer un MoE et discuter avec
ollama run qwen3:30b-a3b

# Pour comparer avec un dense de taille voisine
ollama run qwen3:32b
i
Verificare il throughput
Aggiungi il flag --verbose (ollama run qwen3:30b-a3b --verbose) per vedere i token al secondo alla fine della risposta e confrontare oggettivamente modelli MoE e densi sul tuo dispositivo.

#Per approfondire

Il MoE si comprende meglio collegandolo alle altre nozioni di base dell'IA locale. Queste guide approfondiscono direttamente quanto trattato in questa guida:

Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Il MoE è sensibile a una quantizzazione eccessivamente aggressiva: questo manuale aiuta a trovare il giusto equilibrio tra qualità e memoria.
Installare Ollama: Windows, macOS e Linux
Per configurare il daemon locale sulla porta 11434 prima di scaricare il tuo primo MoE.
Llama 4 Scout in locale: installazione e primi test con Ollama
Un MoE multimodale spiegato passo dopo passo, per vedere in azione la teoria di questo manuale.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.