Benchmark dei LLM locali: MMLU, HumanEval, AIME 2026

Un benchmark LLM locale interpretato senza tener conto della metodologia equivale a confrontare due tempi di maratona senza il profilo altimetrico del percorso. Due modelli annunciati con 88 punti su MMLU possono differire di 16 punti su MMLU-Pro e di 30 punti su AIME 2026 a seconda della presenza di un addestramento chain-of-thought, del formato di quantizzazione, del protocollo di decodifica (cons@64 vs pass@1 strict) e della versione esatta del dataset caricato. Questa pagina non è una guida all'acquisto: è una griglia di audit delle tre suite storiche (MMLU/MMLU-Pro, HumanEval/HumanEval+, AIME 2024/2025/2026), con punteggi pubblicati, condizioni di riproducibilità, consumo di VRAM in Q4 misurato, velocità in token al secondo su configurazioni reali e un inventario dei bias che i comunicati dei fornitori passano sotto silenzio. L'obiettivo è fornire strumenti: permettere di riprodurre autonomamente un risultato con un seed fissato, non di scegliere tra modelli proprietari e open-weights.

Perché il quadro interpretativo del 2026 invalida i benchmark precedenti al 2024

L'ecosistema è cambiato in due anni. MMLU con 4 opzioni di risposta raggiungeva la saturazione già con Llama 3.1 405B a 88,6, e le architetture con attivazione degli esperti (DeepSeek V3, Qwen 3, GLM-5.1) sono ormai vicini al limite massimo; leggere un punteggio MMLU con una precisione di mezzo punto non offre più alcun valore informativo. Tre cambiamenti strutturali hanno ridefinito il quadro:

  1. Modelli di ragionamento addestrati con RL (DeepSeek R1, Ring-1T, gpt-oss 120B con thinking attivabile) che trasformano AIME e MATH-500 in discriminanti di primo piano. Su AIME 2024, la differenza Llama 3.1 405B (~23 pass@1) vs DeepSeek R1 671B (~79 pass@1) raggiunge 55 punti — un delta impossibile da osservare su MMLU.
  2. Conteggio dei parametri totali rispetto ai parametri attivi. Qwen 3 235B-A22B attiva soltanto 22B parametri per token, MiniMax-M2.7 segue la stessa logica MoE. Il benchmark va interpretato a parità di costo d'inferenza (token/secondo × VRAM), non in base al numero totale di parametri indicato.
  3. Suite anti-contaminazione. LiveBench rinnova i propri quesiti ogni mese, LiveCodeBench associa una marca temporale ai problemi di Codeforces per isolare quelli successivi alla data limite dei dati di preaddestramento, SimpleBench misura la robustezza del senso comune laddove MMLU raggiunge il proprio limite. La HuggingFace Open LLM Leaderboard v2 è esplicitamente passata a MMLU-Pro, GPQA, MUSR e IFEval per questo motivo.

Leggere un singolo punteggio non dice più nulla: solo la matrice {MMLU-Pro, HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k, GPQA Diamond} fornisce un segnale significativo. La guida /guide/matrice-benchmarks-2026 spiega la ponderazione consigliata.

Metodologia: ciò che misura realmente ogni suite

Le MMLU LLM (Massive Multitask Language Understanding, Hendrycks et al. 2021) copre 57 discipline (medicina, diritto, etica, matematica elementare) con domande a scelta multipla a 4 opzioni, protocollo 5-shot standard. Repo di riferimento: GitHub Hendrycks, articolo arXiv:2009.03300. Oltre l'85%, è stato soppiantato da MMLU-Pro (10 scelte, ragionamento a più fasi, 12 032 elementi) su HuggingFace TIGER-Lab, con un calo tipico da 15 a 25 punti rispetto al MMLU classico. Variante emergente: MMLU-Redux (articolo arXiv:2406.04127) corregge circa il 6,5 % degli elementi riconosciuti come errati o ambigui del set originale — un aspetto raramente sottolineato che spiega perché due esecuzioni identiche possono differire da 1 a 2 punti a seconda della versione caricata. Per i filtri e la procedura di valutazione, vedere /guide/mmlu-pro-protocole-strict.

HumanEval, pubblicato da OpenAI (arXiv:2107.03374), valuta 164 problemi Python con firme di funzione e test unitari. La metrica standard è pass@1 mais pass@10 et pass@100 richiedono rispettivamente 10 e 100 esempi per problema, moltiplicando così il costo dell'evaluazione. Il suo successore HumanEval+ (evalplus) aggiunge circa 80 volte più casi di test generati tramite mutazione; i modelli sovraaddestrati perdono tipicamente da 5 a 10 punti tra le due versioni, il che rivela direttamente il grado di overfitting sui test originali. Per approfondire il tema del codice reale, SWE-bench Verified misura la risoluzione di issue GitHub autentiche (500 ticket validati manualmente) e LiveCodeBench mantiene un flusso di problemi Codeforces con marcatura temporale, filtrabili per data. La procedura completa di estrazione su HumanEval+ è trattata in /guide/humaneval-plus-protocole.

AIME 2024 LLM corrisponde ai 15 problemi annuali dell'American Invitational Mathematics Examination (due sessioni, AIME I e II), con risposte intere comprese tra 0 e 999. Divenuto centrale con i modelli di ragionamento, distingue nettamente le architetture con o senza chain-of-thought addestrato tramite RL. Il set del 2024 è citato nella model card DeepSeek R1. AIME 2025 (marzo 2025) e poi AIME 2026 (febbraio 2026) fungono ormai da prove nuove, perché i testi dei problemi del 2024 sono stati indicizzati su vasta scala. I rapporti tecnici di fine 2025 usano spesso cons@64 (voto a maggioranza su 64 campioni, temperatura 0.6, top-p 0.95), il che può gonfiare il punteggio grezzo di 10–15 punti rispetto a un pass@1 rigoroso a temperatura 0.

Al di là di questi tre pilastri, la griglia 2026 aggiunge GPQA Diamond (198 domande di livello dottorale validate da esperti), MATH-500 (problemi delle olimpiadi), MuSR (ragionamento narrativo a più fasi), RULER (recupero di informazioni in contesti lunghi fino a 1M token), IFEval (rispetto di istruzioni rigorose), BFCL v3 (Berkeley Function Calling Leaderboard) per le chiamate strutturate agli strumenti. I rapporti tecnici seri pubblicano ormai questa matrice completa anziché un singolo punteggio MMLU.

Punteggi pubblicati: analisi comparativa a parità di hardware

I dati riportati di seguito provengono dalle schede tecniche ufficiali o dai rapporti HuggingFace. Restano da riprodurre tramite lm-evaluation-harness di EleutherAI, l'unico protocollo indipendente autorevole nella comunità open-source.

Livello S — modelli di ragionamento di frontiera (> 600B parametri) :

Livello A — eseguibile su un numero di GPU di fascia alta compreso tra 1 e 4 (da 100B a 400B) :

Livello B — una sola workstation (da 40 a 80 GB di VRAM) :

Confronti stretti disponibili su /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b et /compare/qwen3-235b-a22b-vs-llama-3-1-405b.

Costo hardware dettagliato: VRAM, quantizzazioni, velocità misurate

Un punteggio grezzo non vale nulla senza il costo di inferenza associato. I valori qui sotto corrispondono al formato Q4_K_M di llama.cpp. Le conversioni a Q5_K_M, Q8_0 o FP16 moltiplicano la VRAM approssimativamente per 1,25, 2 e 4. La calcolatrice quelllm.fr/configurateur filtra per budget GPU.

Modello VRAM Q4 Configurazione obiettivo Velocità indicativa Q4
DeepSeek V4 Pro 1.6T ~960 GB 8×H200 141 GB, pod TPU v5p 15-20 tok/s tensor-parallel
MiMo V2.5 Pro 1020B ~595 GB 8×H100 80 GB tensor-parallel 20-30 tok/s
Mistral Large 3 675B ~405 GB 6×H100 80 GB o 4×H200 25-35 tok/s
Llama 3.1 405B ~240 GB 4×A100 80 GB o 3×H100 20-30 tok/s
Qwen 3 235B-A22B ~142 GB 2×H100 o 1×H200 141 GB 40-60 tok/s (MoE)
Hunyuan Large 2.0 ~245 GB 3×H100 80 GB 25-30 tok/s
gpt-oss 120B ~70 GB 1×H100, Mac Studio M3 Ultra 192 GB 35-50 tok/s
Mistral Small 4 119B ~72 GB 1×H100, A100 80 GB 30-45 tok/s
Llama 3.3 70B ~40 GB RTX A6000 48 GB, 2×RTX 4090 15-25 tok/s su 2×4090
DBRX Instruct 132B ~76 GB 1×H100, 2×A100 40 GB 30-40 tok/s

I numeri sono ordini di grandezza in single-batch; i deployment multi-tenant con vLLM o SGLang raggiungono un throughput aggregato fino a 5 volte superiore grazie al continuous batching e al prefix caching. Su Mac Studio M3 Ultra (larghezza di banda della memoria di 800 GB/s), Llama 3.3 70B in Q4_K_M raggiunge da 8 a 12 tok/s in single-stream in base alla lunghezza effettiva del contesto. Le architetture MoE (Mixtral 8x22B, Qwen 3, DeepSeek V3) beneficiano particolarmente di SGLang grazie al routing degli esperti condiviso nei batch. La guida /guide/quantization-q4-q5-q8 dettaglia i compromessi qualità/VRAM e /guide/inference-vllm-vs-llamacpp confronta i motori in modo approfondito. Per eseguire un benchmark della tua configurazione, vedere /guide/bench-tokens-par-seconde.

Tre bias che distorcono l'interpretazione delle classifiche

  1. Contaminazione dei dataset. MMLU e HumanEval circolano dal 2021; alcuni modelli hanno visto le domande durante il pre-addestramento, il che gonfia artificialmente i punteggi. Il lavoro LiveCodeBench propone un monitoraggio temporale dei problemi per HumanEval per isolare quelli successivi alla data limite del preaddestramento. Il rilevamento della contaminazione tramite sovrapposizione di n-grammi (metodo arXiv:2311.04850) mostra che fino al 12 % degli item MMLU compare testualmente nei corpus web indicizzati.
  2. Varianza della decodifica. Un punteggio AIME pass@1 calcolato con temperatura 0.6 e 64 campioni (cons@64, voto di maggioranza) può differire di 10 punti da un pass@1 rigoroso a temperatura 0. Su GSM8K, lo scarto dovuto alla self-consistency raggiunge da 5 a 8 punti a seconda del numero di campioni. Verificare sempre temperature, top_p, max_tokens, numero di campioni e regola di aggregazione nella scheda del modello o nel rapporto tecnico.
  3. Prompt specifici. I rapporti DeepSeek, Qwen e Mistral usano spesso prompt di sistema ottimizzati, a volte con esempi few-shot selezionati manualmente. Riprodurre i risultati in modalità zero-shot senza ottimizzazioni dà in genere da 3 a 8 punti in meno, a volte di più sulle suite di test di ragionamento. Per AIME, l'aggiunta di un prefisso "Let's think step by step" può spostare il punteggio da 4 a 6 punti sui modelli non addestrati al thinking.

I benchmark orientati ai compiti degli utenti — LMArena (ex Chatbot Arena), LiveBench, SWE-bench Verified — offrono un complemento meno suscettibile di manipolazione. SWE-bench resta il riferimento per valutare un modello agentico su codice reale: DeepSeek V3.2 et Qwen3-Coder-Next 80B-A3B vi ottengono punteggi superiori al 40 %, valori da confermare nella classifica aggiornata. BFCL v3 aggiunge la dimensione del tool calling strutturato, utile per i deployment agentici.

Riprodurre un benchmark dall'inizio alla fine: procedura tipo

Per ottenere un punteggio AIME 2026 difendibile con, ad esempio, DeepSeek R1 Distill Llama 70B :

  1. Scaricare i pesi su HuggingFace (# HuggingFace : deepseek-ai/DeepSeek-R1-Distill-Llama-70B) poi convertirli in GGUF Q4_K_M tramite llama.cpp/convert_hf_to_gguf.py se punti a CPU/Apple, oppure restare in safetensors per vLLM.
  2. Impostare gli iperparametri : temperatura 0.6, top-p 0.95, max_tokens 32768 (il modello deve ragionare a lungo), seed salvata per la riproducibilità.
  3. Caricare il set AIME 2026 da un dataset HuggingFace aggiornato. Verificare che l'editore non abbia incluso per errore la soluzione nel prompt — difetto frequente nei fork recenti.
  4. Generare 64 completamenti per problema per cons@64, e 1 completamento a temperatura 0 per pass@1 rigoroso.
  5. Estrarre la risposta finale tramite regex sul tag \boxed{} o l'ultima sequenza da 1 a 3 cifre. Gestire il caso in cui il modello emetta più tag <thinking> annidate.
  6. Confrontare con le soluzioni ufficiali AIME (intero 0-999), pubblicare script e seed.

Mettere in conto circa 6–10 ore su 2×H100 per un 70B in cons@64 sui 15 problemi AIME 2026. La guida /guide/reproduire-benchmark-aime descrive le insidie dell'estrazione della risposta, in particolare la gestione dei tag <thinking> per i modelli di ragionamento e la normalizzazione delle frazioni di uscita.

Casi di studio con dati numerici: tre scenari concreti

Scenario A — laboratorio universitario con 4×A100 80 GB per la valutazione del ragionamento matematico. Obiettivo: produrre una curva AIME 2024/2025/2026 riproducibile. Una buona scelta: DeepSeek R1 Distill Llama 70B in Q8_0 (140 GB, due GPU), rispetto a Llama 3.3 70B senza ragionamento sulle due GPU rimanenti per misurare il contributo puro del chain-of-thought. Costo di un ciclo completo cons@64 sui 45 problemi (AIME 2024 + 2025 + 2026): circa 30 ore GPU. Vedi /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b.

Scenario B — startup con 1×H100 80 GB per benchmarkare un assistente per il codice. Tre candidati a confronto: Qwen3-Coder-Next 80B-A3B, gpt-oss 120B et Mistral Small 4 119B. Protocollo: HumanEval+ pass@1, MBPP+ pass@1, LiveCodeBench filtrato sui problemi successivi a ottobre 2024, SWE-bench Verified Lite (50 issue). Il throughput MoE di Qwen3-Coder-Next (3B attivi) permette tipicamente 3 volte più candidati all'ora rispetto ai densi con VRAM equivalente, il che riduce l'interesse per una quantizzazione aggressiva.

Scenario C — team dati con Mac Studio M3 Ultra da 192 GB. La banda passante della memoria, 800 GB/s, rimane il fattore limitante. Llama 3.3 70B Q5_K_M entra comodamente in memoria e fornisce da 6 a 10 token al secondo. Qwen 3 235B-A22B in Q4 ci sta appena, con 142 GB, e offre 4-6 tok/s ma una qualità superiore. gpt-oss 120B in Q4 occupa 70 GB e lascia margine per la cache KV per contesti lunghi. Vedi /guide/llm-mac-studio-m3-ultra.

Scenario D — misurare tramite benchmark una regressione tra due checkpoint sottoposti a fine-tuning. Caso industriale tipico: un fine-tuning LoRA su 10k esempi di settore su Llama 3.3 70B. Il rischio è una regressione catastrofica delle capacità generali. Protocollo minimo: MMLU (5-shot), IFEval, GSM8K, HumanEval+ prima e dopo il fine-tuning, con lo stesso seed. Un calo superiore a 2 punti in 2 delle 4 suite indica overfitting. Vedi /guide/fine-tuning-sans-regression.

Licenze e condizioni esatte d'uso commerciale

Le benchmark LLM locale non serve a nulla se la licenza vieta il deployment previsto. Quattro famiglie dominano l'ecosistema open-weights del 2026:

Per un confronto dettagliato per licenza, vedere /guide/licences-llm-open-source.

Scegliere un modello in base al profilo di benchmark desiderato

FAQ

Q: Qual è la differenza tra MMLU e MMLU-Pro?

MMLU prevede 4 opzioni per domanda e, per i migliori modelli open-weights, i punteggi si fermano intorno all’88-90%, il che lo rende poco discriminante. MMLU-Pro passa a 10 opzioni, elimina le domande ambigue e aggiunge quesiti che richiedono un ragionamento in più passaggi. I punteggi scendono tipicamente di 15-25 punti, ripristinando così il potere discriminante. Per confrontare modelli moderni come DeepSeek V3.2 o Qwen 3 235B-A22B, MMLU-Pro è ormai più pertinente del classico MMLU.

Q: Come riprodurre un punteggio HumanEval localmente?

Installare evalplus, caricare il modello tramite vLLM o llama.cpp, generare da 1 a 200 completamenti per problema in base alla metrica desiderata, poi eseguire i test Python. Prevedere una giornata di GPU per un modello da 70B in pass@1 sui 164 problemi, di più per pass@100. Un punteggio a temperatura 0 differisce da un punteggio mediato su più campioni: documentare sempre gli iperparametri e pubblicare lo script per consentire il confronto incrociato.

Q: È meglio preferire Q4, Q5 o Q8 per un benchmark affidabile?

Q4_K_M perde tipicamente da 1 a 3 punti su MMLU rispetto al FP16, talvolta di più su AIME, dove i ragionamenti lunghi sono sensibili agli errori cumulativi. Q5_K_M e Q6_K riducono il divario a meno di un punto. Q8_0 è quasi indistinguibile dal FP16 nella maggior parte delle suite di test. Per eseguire benchmark in modo onesto, indicare sempre la quantizzazione utilizzata. La guida /guide/quantization-q4-q5-q8 dettaglia le perdite misurate per formato.

Q: I punteggi AIME 2024 sono contaminati?

I testi dei problemi AIME 2024 sono stati pubblicati online a febbraio 2024 e indicizzati dai crawler poco dopo. I modelli con una data limite per i dati di addestramento successiva alla metà del 2024 possono quindi aver visto le soluzioni. Per questo motivo, AIME 2025 e AIME 2026 sono preferiti nelle valutazioni recenti, a condizione che i modelli non siano stati esposti a tali soluzioni. Verificare sempre nella model card la data limite dei dati di preaddestramento dichiarata dal produttore e incrociare le informazioni con LiveBench per conferma.

Q: Qual modello per un sistema con 24 GB di VRAM?

24 GB escludono i modelli 70B+ in Q4, che richiedono almeno 40 GB. Le opzioni praticabili sono modelli da 30B a 40B in Q4, oppure modelli 70B con quantizzazioni aggressive come IQ2_XXS, al prezzo di una perdita significativa di qualità (da 5 a 10 punti su MMLU). Per mantenere una qualità accettabile, puntare a modelli da 14B a 32B. Vedere il configuratore su /configurateur per un filtraggio per VRAM.

Q: Perché i punteggi variano tra HuggingFace e i report dei venditori?

I produttori ottimizzano i prompt, usano strategie di decodifica specifiche (cons@64, majority voting) e a volte selezionano le migliori esecuzioni con diversi seed. Le classifiche indipendenti come HuggingFace Open LLM Leaderboard impongono un protocollo uniforme (zero-shot o few-shot fisso, prompt standardizzati). È attesa una differenza da 3 a 10 punti tra le due fonti. In produzione, conta il protocollo riproducibile, non il valore massimo.

Conclusione

Un benchmark LLM locale letto senza tenere conto della licenza, della quantizzazione e del protocollo di decodifica è fuorviante. Un metodo robusto consiste nell'incrociare almeno MMLU-Pro, HumanEval+, AIME 2025/2026 e un benchmark agentico come SWE-bench Verified, verificando la VRAM richiesta e la licenza prima di qualsiasi impegno. Qui l'ambito è volutamente limitato alla misurazione: ciò che conta in questa pagina è la capacità di riprodurre un valore pubblicato, comprenderne il margine di errore e verificare che il modello rientri nelle capacità del tuo hardware. Per filtrare i modelli indicizzati in base al tuo budget per la GPU e al tuo caso d'uso, avvia il configuratore quelllm.fr o sfoglia il catalogo completo.

Articolo pubblicato e aggiornato il da Mohamed Meguedmi · Fonte dati: /api/models.json · Licenza dei contenuti: CC BY 4.0.

Un errore o un aggiornamento da segnalare? Contribuire.