MMLU-Pro: il benchmark delle conoscenze per i LLM locali

Le benchmark MMLU-Pro è diventato il riferimento per valutare la profondità delle conoscenze e la capacità di ragionamento dei modelli open-weights eseguiti localmente. Pubblicato nel 2024 da TIGER-Lab, questo benchmark MMLU-Pro corregge i punti deboli del MMLU originale (saturazione, domande ambigue, risposte a scelta multipla troppo facili da indovinare) introducendo 12.032 domande con 10 opzioni di risposta distribuite su 14 discipline. Questo articolo illustra in dettaglio il protocollo, i punteggi osservati sui modelli del catalogo QualeLLM, l'impatto della quantizzazione sui risultati e il metodo per riprodurre il benchmark a casa su GPU consumer o workstation.

Perché MMLU-Pro ha sostituito MMLU nelle valutazioni serie

Il MMLU classico (Hendrycks et al., 2020) si assesta su un massimo di circa l'88-90% per i migliori modelli, il che rende quasi impossibile distinguere tra i modelli di frontiera. Il paper arXiv 2406.01574 introduce tre correzioni principali:

Risultato: il punteggio medio scende da 15 a 25 punti rispetto a MMLU. Un modello che ottiene l'86 % su MMLU scende tipicamente intorno al 66 % su MMLU-Pro. Questa compressione verso il basso restituisce significato alla misurazione per confrontare modelli moderni a pesi aperti.

Il dataset completo è ospitato su HuggingFace TIGER-Lab/MMLU-Pro e la valutazione di riferimento avviene attraverso il repository GitHub ufficiale.

Punteggi MMLU-Pro osservati sul catalogo QualeLLM

I punteggi riportati di seguito provengono dalla classifica ufficiale TIGER-Lab e dai rapporti tecnici dei produttori. I valori contrassegnati con "stimato" provengono da misurazioni parziali della comunità, da confermare.

Le differenze tra categorie (diritto, medicina, ingegneria) possono raggiungere 20 punti per lo stesso modello: un punteggio medio nasconde spesso una debolezza disciplinare.

Impatto della quantizzazione sul punteggio MMLU degli LLM

La quantizzazione riduce la VRAM ma peggiora i punteggi. Le misurazioni empiriche sui modelli del catalogo danno questi ordini di grandezza (fonti: issue di llama.cpp, rapporti di Unsloth):

Per Llama 3.3 70B Instruct, ad esempio, si osserva un calo da ~68 % in FP16 a ~64 % in Q4_K_M sul sottoinsieme "law". Su Qwen 2.5 72B Instruct, lo scarto è più contenuto (1,5 punti). La regola pratica: Q5_K_M rimane il miglior compromesso per le valutazioni serie, Q4 è adatto all'uso quotidiano.

Vedere il Guida alla quantizzazione GGUF per i dettagli sui formati.

VRAM e costo dell'hardware per eseguire il benchmark delle conoscenze

Riprodurre MMLU-Pro localmente richiede di caricare il modello in memoria e di generare circa 12.032 risposte (con CoT, ciò equivale a un numero di token di output compreso tra 5 e 10 milioni). Costo hardware per fascia:

Un benchmark completo su un 70B in Q4 richiede da 4 a 8 ore su RTX 6000 Ada, a seconda del throughput (~25-35 token/sec). Per calibrare il tuo setup, lo strumento /configurateur suggerisce l'hardware adatto alla quantità di VRAM desiderata.

Metodo per riprodurre il benchmark localmente

Il protocollo standard utilizza vllm o llama.cpp all'interno del backend, con lo script Python ufficiale del repository TIGER-AI-Lab.

Passi principali:

  1. Download del dataset da HuggingFace (circa 12 MB).
  2. Configurazione del modello in modalità completamento chat con temperatura 0 e top-p 1. Il prompt di sistema deve includere 5 esempi few-shot per categoria (CoT attivato).
  3. Avvio della valutazione disciplina per disciplina (14 categorie: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
  4. Parsing delle risposte : estrazione della lettera finale (da A a J) tramite regex sull'ultima riga.
  5. Calcolo del punteggio ponderato per categoria o medio globale.

Dettagli completi nel README GitHub. Per confrontare due modelli fianco a fianco, vedi /compare/llama33-70b-vs-qwen25-72b o consultare il ranking generale su /meilleur-llm/raisonnement.

Limiti del MMLU-Pro e benchmark complementari

Nessun benchmark è sufficiente da solo. MMLU-Pro misura conoscenze accademiche e ragionamento strutturato, ma non copre:

Una suite di test robusta combina almeno MMLU-Pro + HumanEval + GSM8K + un benchmark agentico.

FAQ

Q: Qual è la differenza pratica tra MMLU e MMLU-Pro?

MMLU ha 4 opzioni per domanda e raggiunge la saturazione oltre l'88%. MMLU-Pro passa a 10 opzioni, filtra le domande ambigue e integra il ragionamento in più passaggi. Risultato: i punteggi scendono da 15 a 25 punti, ripristinando la capacità di distinguere le prestazioni dei modelli. Per gli utilizzi dal 2025 in poi, MMLU-Pro è ormai il riferimento nei rapporti tecnici dei produttori.

Q: Serve attivare il chain-of-thought per valutare un modello?

Sì per i benchmark comparativi, poiché il protocollo ufficiale MMLU-Pro ne fa uso. Senza CoT, i punteggi scendono da 5 a 15 punti a seconda del modello. Su DeepSeek R1 671B, la modalità di ragionamento guadagna circa 8 punti rispetto a una chiamata diretta. Per misurare la pertinenza in produzione senza CoT, esegui separatamente la valutazione in modalità "answer only".

Q: Posso eseguire il benchmark delle conoscenze su un Mac M4?

Sì, tramite llama.cpp o MLX. Un Mac Studio M4 Max con 128 GB esegue Llama 3.3 70B Instruct in Q4 (~40 GB) a 8-12 token/sec, cioè da 6 a 10 ore per il benchmark completo. I modelli oltre i 100B richiedono un M4 Ultra da 192 GB o un offloading su SSD molto lento. Vedi il guida Mac Apple Silicon per le configurazioni consigliate.

Q: Il punteggio MMLU-Pro è affidabile per scegliere un modello professionale?

In parte. MMLU-Pro riflette bene le capacità generaliste, ma un punteggio complessivo del 70% può nascondere un 55% in diritto e un 82% in fisica. Se il tuo caso d'uso riguarda una disciplina specifica, consulta il punteggio per categoria pubblicato nella classifica. Per un uso di programmazione o giuridico in lingua francese, integra la valutazione con HumanEval-FR e un test interno sui tuoi dati.

Q: Qual è la licenza dei modelli ai primi posti del benchmark?

I migliori punteggi open-weights provengono da modelli con licenze permissive: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Da notare: Llama 3.1 405B Instruct è sotto licenza Llama 3.1 Community (restrizioni oltre 700M MAU). Verifica ogni licenza prima di un deployment commerciale.

Q: Quanto costa una valutazione completa su GPU noleggiata?

A 2 €/h per una H100 da 80 GB tramite un cloud bare-metal, un benchmark MMLU-Pro completo su un 70B in Q4 costa da 8 a 16 € a seconda del throughput. Per un 405B in Q4 che richiede 4 H100, metti in conto da 80 a 160 €. È nettamente più economico che acquistare l'hardware, ma l'inferenza locale resta pertinente per valutazioni ripetute o dati sensibili.

Conclusione

Le benchmark MMLU-Pro offre oggi la misura più discriminante delle conoscenze e del ragionamento per gli LLM a pesi aperti. Combinato con benchmark specializzati (HumanEval, AIME, LongBench), permette di orientare oggettivamente la scelta di un modello. Per identificare la configurazione hardware che ti permette di eseguire i migliori modelli della classifica, usa il configuratore QualeLLM o esplora i 249 modelli indicizzati sul catalogo completo.

Articolo pubblicato il da Mohamed Meguedmi · Fonte dati: /api/models.json · Licenza dei contenuti: CC BY 4.0.

Un errore o un aggiornamento da segnalare? Contribuire.