MMLU-Pro: il benchmark delle conoscenze per i LLM locali
Le benchmark MMLU-Pro è diventato il riferimento per valutare la profondità delle conoscenze e la capacità di ragionamento dei modelli open-weights eseguiti localmente. Pubblicato nel 2024 da TIGER-Lab, questo benchmark MMLU-Pro corregge i punti deboli del MMLU originale (saturazione, domande ambigue, risposte a scelta multipla troppo facili da indovinare) introducendo 12.032 domande con 10 opzioni di risposta distribuite su 14 discipline. Questo articolo illustra in dettaglio il protocollo, i punteggi osservati sui modelli del catalogo QualeLLM, l'impatto della quantizzazione sui risultati e il metodo per riprodurre il benchmark a casa su GPU consumer o workstation.
Perché MMLU-Pro ha sostituito MMLU nelle valutazioni serie
Il MMLU classico (Hendrycks et al., 2020) si assesta su un massimo di circa l'88-90% per i migliori modelli, il che rende quasi impossibile distinguere tra i modelli di frontiera. Il paper arXiv 2406.01574 introduce tre correzioni principali:
- 10 opzioni per domanda invece di 4 : la probabilità di rispondere correttamente scegliendo a caso passa dal 25% al 10%, il che allarga l'intervallo dei punteggi.
- Filtraggio manuale delle domande ambigue : circa 5.000 domande del MMLU originale sono state eliminate o riformulate da esperti.
- Aggiunta di domande che richiedono un elevato livello di ragionamento : integrazione di problemi delle discipline STEM (TheoremQA, SciBench) che richiedono un calcolo in più passaggi anziché il semplice recupero di informazioni memorizzate.
Risultato: il punteggio medio scende da 15 a 25 punti rispetto a MMLU. Un modello che ottiene l'86 % su MMLU scende tipicamente intorno al 66 % su MMLU-Pro. Questa compressione verso il basso restituisce significato alla misurazione per confrontare modelli moderni a pesi aperti.
Il dataset completo è ospitato su HuggingFace TIGER-Lab/MMLU-Pro e la valutazione di riferimento avviene attraverso il repository GitHub ufficiale.
Punteggi MMLU-Pro osservati sul catalogo QualeLLM
I punteggi riportati di seguito provengono dalla classifica ufficiale TIGER-Lab e dai rapporti tecnici dei produttori. I valori contrassegnati con "stimato" provengono da misurazioni parziali della comunità, da confermare.
- DeepSeek V3 671B : 75,9 % — miglior punteggio rilevato per un modello generalista open-weights a fine 2024. Scheda completa su /modele/deepseek-v3-671b.
- DeepSeek R1 671B : 84,0 % (ragionamento attivato) — guadagno di ~8 punti grazie al chain-of-thought interno. Dettagli su /modele/deepseek-r1-671b.
- Qwen 3 235B-A22B : 72,1 % stimato — architettura MoE, vedi /modele/qwen3-235b-a22b.
- Llama 3.1 405B Instruct : 73,3 % — riferimento Meta, scheda /modele/llama-3-1-405b.
- Llama 3.3 70B Instruct : 68,9 % — miglior rapporto prestazioni/VRAM per workstation con 40 GB, scheda /modele/llama33-70b.
- Mistral Large 3 675B : 71,5 % stimato — vedi /modele/mistral-large-3.
- gpt-oss 120B : 70,2 % stimato — variante distillata OpenAI, scheda /modele/gpt-oss-120b.
- Qwen 2.5 72B Instruct : 65,4 % — base solida multilingue, scheda /modele/qwen25-72b.
- Mixtral 8x22B Instruct : 56,2 % — storico ma ancora pertinente per il confronto, scheda /modele/mixtral-8x22b.
Le differenze tra categorie (diritto, medicina, ingegneria) possono raggiungere 20 punti per lo stesso modello: un punteggio medio nasconde spesso una debolezza disciplinare.
Impatto della quantizzazione sul punteggio MMLU degli LLM
La quantizzazione riduce la VRAM ma peggiora i punteggi. Le misurazioni empiriche sui modelli del catalogo danno questi ordini di grandezza (fonti: issue di llama.cpp, rapporti di Unsloth):
- FP16 → Q8_0 : perdita < 0,5 punti su MMLU-Pro, generalmente non significativa.
- Q8 → Q5_K_M : perdita da 1 a 2 punti a seconda delle discipline (la matematica è maggiormente penalizzata).
- Q5 → Q4_K_M : perdita da 2 a 4 punti, più marcata nelle domande che richiedono un ragionamento in più passaggi.
- Q4 → Q3 : possibile crollo (> 5 punti), da evitare per impieghi impegnativi.
Per Llama 3.3 70B Instruct, ad esempio, si osserva un calo da ~68 % in FP16 a ~64 % in Q4_K_M sul sottoinsieme "law". Su Qwen 2.5 72B Instruct, lo scarto è più contenuto (1,5 punti). La regola pratica: Q5_K_M rimane il miglior compromesso per le valutazioni serie, Q4 è adatto all'uso quotidiano.
Vedere il Guida alla quantizzazione GGUF per i dettagli sui formati.
VRAM e costo dell'hardware per eseguire il benchmark delle conoscenze
Riprodurre MMLU-Pro localmente richiede di caricare il modello in memoria e di generare circa 12.032 risposte (con CoT, ciò equivale a un numero di token di output compreso tra 5 e 10 milioni). Costo hardware per fascia:
- 24 GB VRAM (RTX 4090) : limita la scelta a modelli da ~30B in Q4; nessun accesso ai grandi modelli open-weights.
- 48 GB VRAM (2× RTX 4090 o RTX 6000 Ada) : permette di eseguire Llama 3.3 70B Instruct in Q4 (~40 GB), Qwen 2.5 72B Instruct (~42 GB), Qwen3-Coder-Next 80B-A3B (~48 GB).
- 96 GB VRAM (2× RTX 6000 Ada) : consente di eseguire Mixtral 8x22B Instruct (~82 GB), gpt-oss 120B (~70 GB), Mistral Small 4 (~72 GB).
- 160-200 GB VRAM (4-5× RTX 6000 Ada o H100) : Llama 3.1 405B Instruct in Q4 (~240 GB con offloading CPU), Qwen 3 235B-A22B (~142 GB).
- 400+ GB VRAM (cluster H100/H200) : DeepSeek V3 671B, DeepSeek R1 671B, Kimi K2.5 e oltre.
Un benchmark completo su un 70B in Q4 richiede da 4 a 8 ore su RTX 6000 Ada, a seconda del throughput (~25-35 token/sec). Per calibrare il tuo setup, lo strumento /configurateur suggerisce l'hardware adatto alla quantità di VRAM desiderata.
Metodo per riprodurre il benchmark localmente
Il protocollo standard utilizza vllm o llama.cpp all'interno del backend, con lo script Python ufficiale del repository TIGER-AI-Lab.
Passi principali:
- Download del dataset da HuggingFace (circa 12 MB).
- Configurazione del modello in modalità completamento chat con temperatura 0 e top-p 1. Il prompt di sistema deve includere 5 esempi few-shot per categoria (CoT attivato).
- Avvio della valutazione disciplina per disciplina (14 categorie: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
- Parsing delle risposte : estrazione della lettera finale (da A a J) tramite regex sull'ultima riga.
- Calcolo del punteggio ponderato per categoria o medio globale.
Dettagli completi nel README GitHub. Per confrontare due modelli fianco a fianco, vedi /compare/llama33-70b-vs-qwen25-72b o consultare il ranking generale su /meilleur-llm/raisonnement.
Limiti del MMLU-Pro e benchmark complementari
Nessun benchmark è sufficiente da solo. MMLU-Pro misura conoscenze accademiche e ragionamento strutturato, ma non copre:
- Il codice : utilizzare HumanEval, MBPP o LiveCodeBench. Il modello Qwen3-Coder-Next 80B-A3B è progettato per questa categoria (fiche).
- La matematica avanzata : AIME, MATH, GSM8K rimangono indispensabili. DeepSeek R1 671B brilla particolarmente qui.
- Multilingue: MGSM, Multilingual MMLU, Belebele per il francese. Mistral Large 3 675B e Rakuten AI 3.0 sono valutati meglio sotto questi aspetti.
- Il contesto lungo : RULER, LongBench. Llama 4 Scout 109B (10M token di contesto) o MiMo V2.5 Pro (1M token) sono i punti di riferimento in questo ambito.
- L'agentique : SWE-bench, BFCL, AgentBench.
Una suite di test robusta combina almeno MMLU-Pro + HumanEval + GSM8K + un benchmark agentico.
FAQ
Q: Qual è la differenza pratica tra MMLU e MMLU-Pro?
MMLU ha 4 opzioni per domanda e raggiunge la saturazione oltre l'88%. MMLU-Pro passa a 10 opzioni, filtra le domande ambigue e integra il ragionamento in più passaggi. Risultato: i punteggi scendono da 15 a 25 punti, ripristinando la capacità di distinguere le prestazioni dei modelli. Per gli utilizzi dal 2025 in poi, MMLU-Pro è ormai il riferimento nei rapporti tecnici dei produttori.
Q: Serve attivare il chain-of-thought per valutare un modello?
Sì per i benchmark comparativi, poiché il protocollo ufficiale MMLU-Pro ne fa uso. Senza CoT, i punteggi scendono da 5 a 15 punti a seconda del modello. Su DeepSeek R1 671B, la modalità di ragionamento guadagna circa 8 punti rispetto a una chiamata diretta. Per misurare la pertinenza in produzione senza CoT, esegui separatamente la valutazione in modalità "answer only".
Q: Posso eseguire il benchmark delle conoscenze su un Mac M4?
Sì, tramite llama.cpp o MLX. Un Mac Studio M4 Max con 128 GB esegue Llama 3.3 70B Instruct in Q4 (~40 GB) a 8-12 token/sec, cioè da 6 a 10 ore per il benchmark completo. I modelli oltre i 100B richiedono un M4 Ultra da 192 GB o un offloading su SSD molto lento. Vedi il guida Mac Apple Silicon per le configurazioni consigliate.
Q: Il punteggio MMLU-Pro è affidabile per scegliere un modello professionale?
In parte. MMLU-Pro riflette bene le capacità generaliste, ma un punteggio complessivo del 70% può nascondere un 55% in diritto e un 82% in fisica. Se il tuo caso d'uso riguarda una disciplina specifica, consulta il punteggio per categoria pubblicato nella classifica. Per un uso di programmazione o giuridico in lingua francese, integra la valutazione con HumanEval-FR e un test interno sui tuoi dati.
Q: Qual è la licenza dei modelli ai primi posti del benchmark?
I migliori punteggi open-weights provengono da modelli con licenze permissive: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Da notare: Llama 3.1 405B Instruct è sotto licenza Llama 3.1 Community (restrizioni oltre 700M MAU). Verifica ogni licenza prima di un deployment commerciale.
Q: Quanto costa una valutazione completa su GPU noleggiata?
A 2 €/h per una H100 da 80 GB tramite un cloud bare-metal, un benchmark MMLU-Pro completo su un 70B in Q4 costa da 8 a 16 € a seconda del throughput. Per un 405B in Q4 che richiede 4 H100, metti in conto da 80 a 160 €. È nettamente più economico che acquistare l'hardware, ma l'inferenza locale resta pertinente per valutazioni ripetute o dati sensibili.
Conclusione
Le benchmark MMLU-Pro offre oggi la misura più discriminante delle conoscenze e del ragionamento per gli LLM a pesi aperti. Combinato con benchmark specializzati (HumanEval, AIME, LongBench), permette di orientare oggettivamente la scelta di un modello. Per identificare la configurazione hardware che ti permette di eseguire i migliori modelli della classifica, usa il configuratore QualeLLM o esplora i 249 modelli indicizzati sul catalogo completo.