ARC-AGI 2: testare il ragionamento dei LLM open-source
Le Benchmark ARC-AGI 2 è diventato nel 2025 il riferimento per misurare la generalizzazione e il ragionamento astratto dei modelli LLM a pesi aperti, ben oltre i test a risposta multipla tipo MMLU. Progettato da François Chollet e dalla fondazione Arc Prize, il Benchmark ARC-AGI 2 sottopone i modelli a rompicapi visivi inediti in cui la memorizzazione e la forza bruta non bastano più. Questo articolo passa in rassegna il protocollo di valutazione, i modelli open-source meglio posizionati del catalogo quelllm.fr, i loro costi hardware in termini di VRAM e le buone pratiche per riprodurre questi test in locale.
Che cos'è ARC-AGI 2 e perché cambia le carte in tavola
ARC-AGI 2 è la seconda iterazione dell'Abstraction and Reasoning Corpus, pubblicata nel contesto diArc Prize 2025 con un montepremi di un milione di dollari. Il dataset contiene circa 1.000 compiti pubblici di addestramento, 400 compiti pubblici di valutazione e 100 compiti privati per il test finale. Ogni compito è costituito da una griglia colorata di input e da una griglia di output, con da 2 a 5 esempi. Il modello deve dedurre la regola di trasformazione e poi applicarla a un nuovo caso.
A differenza di MMLU o HumanEval, ARC-AGI 2 non premia né la cultura generale né il riconoscimento di pattern sintattici. Si concentra sul ragionamento LLM in senso stretto: composizione di regole, manipolazione di oggetti, simmetria, conteggio. Secondo il articolo fondamentale di Chollet (arXiv:1911.01547), una persona non addestrata supera l'80% di successo; i migliori LLM open-source si fermavano al 5-15% all'inizio del 2025.
Per capire dove si colloca questo benchmark nell'ecosistema, consultare la nostra guida ai benchmark LLM 2025.
Protocollo di valutazione: cosa misura veramente ARC-AGI 2
Il protocollo ufficiale impone due restrizioni che distinguono ARC-AGI 2 dai benchmark abituali:
- Nessuna contaminazione dei dati : le 100 attività private non vengono mai pubblicate su internet, il che impedisce qualsiasi pre-addestramento distorto.
- Budget di calcolo con un limite massimo : ogni invio è soggetto a un limite di risorse di calcolo per scoraggiare il ricorso costoso alla forza bruta.
Il punteggio ufficiale corrisponde alla percentuale di compiti risolti con due tentativi consentiti (pass@2). Il formato di ingresso consigliato è una griglia ASCII o JSON con codifica colore da 0 a 9. Il repository GitHub ufficiale arc-prize/ARC-AGI-2 fornisce gli script di valutazione, gli harness Python e le baseline di riferimento.
Tre famiglie di approcci dominano le proposte open-source:
- Prompting diretto con una catena di pensiero strutturata
- Test-time training (TTT): fine-tuning rapido sui 2-5 esempi prima dell'inferenza
- Sintesi di programmi : generazione di codice Python che il modello esegue per produrre la griglia
Il test-time training offre oggi i migliori risultati, ma consuma da 2 a 10 volte più token per compito. L'approccio di sintesi di programmi è stato reso popolare dal team MindsAI con la proposta presentata nel 2024 e documentata sul blog Arc Prize.
Modelli open-source candidati: VRAM e licenze
Ecco i modelli del catalogo quelllm.fr più pertinenti per puntare a un punteggio rispettabile su Benchmark ARC-AGI 2, classificati per profilo di hardware.
Fascia altissima (≥ 400 GB di VRAM in Q4) :
- DeepSeek V4 Pro 1.6T — 1600B parametri, licenza MIT, ~960 GB VRAM in Q4, contesto 1.000.000 token. Architettura MoE adatta al ragionamento a più fasi.
- Kimi K2.6 — 1000B, Modified MIT, ~600 GB Q4. Buoni risultati annunciati per le attività di pianificazione.
- Ring-1T — 1000B, MIT, ~600 GB Q4, contesto di 131 072 token, progettato per ragionamenti prolungati.
- DeepSeek R1 671B — 671B, MIT, ~400 GB Q4. Modello di ragionamento con chain-of-thought nativo.
- MiMo V2.5 Pro — 1020B, MIT, ~595 GB Q4, contesto di 1 M token. Interessante per prompt few-shot di grandi dimensioni.
Fascia media accessibile alle workstation (60-250 GB Q4) :
- Qwen 3 235B-A22B — 235B, Apache 2.0, ~142 GB Q4, contesto 131 072.
- gpt-oss 120B — 117B, Apache 2.0, ~70 GB Q4. Buon rapporto tra costo e capacità di ragionamento.
- Nemotron 3 Super 120B — 120B, NVIDIA Open Model License, ~72 GB Q4.
- Llama 4 Scout 109B — 109B, Llama 4 Community, ~65 GB Q4, contesto esteso fino a 10 M token.
- Mistral Small 4 — 119B, Apache 2.0, ~72 GB Q4, contesto 256 000 token.
Profilo per il grande pubblico (≤ 50 GB Q4) :
- Qwen3-Coder-Next 80B-A3B — 80B, Apache 2.0, ~48 GB Q4. Adatto all'approccio di sintesi di programmi.
- DeepSeek R1 Distill Llama 70B — 70B, ~40 GB Q4. Versione distillata del ragionamento R1.
- Llama 3.3 70B Instruct — 70B, ~40 GB Q4.
I valori VRAM Q4 sono stime basate su GGUF Q4_K_M; in Q8 bisogna considerare ×1,9, in FP16 ×3,8. Questi valori rimangono da confermare in base al runtime utilizzato (llama.cpp, vLLM, SGLang).
Performance attese e token/sec
Non è ancora stato consolidato alcun punteggio ufficiale pubblico per questi modelli sulla versione 2 del benchmark — le classifiche evolvono ogni mese. A titolo indicativo, i riscontri della comunità relativi allaArc Prize Leaderboard 2025 collocano i modelli a ragionamento esplicito (R1, Ring-1T) tra l'8% e il 18% in pass@2 senza TTT, e fino al 25-35% con un test-time training aggressivo. Questi dati restano da confermare per le versioni quantizzate Q4.
Quanto alla velocità di generazione, su una configurazione con 2× RTX 6000 Ada (96 GB di VRAM totale) con llama.cpp:
- Llama 3.3 70B Q4 : 18-22 token/sec (stimato)
- gpt-oss 120B Q4 : 12-16 token/sec (stimato)
- Qwen 3 235B-A22B Q4 : 8-12 token/sec in offload parziale CPU
Per confronti dettagliati sulle capacità di ragionamento, consulta DeepSeek R1 vs Llama 3.3 et il top dei modelli di ragionamento.
Pratica: riprodurre ARC-AGI 2 localmente
Per valutare un modello del catalogo su Benchmark ARC-AGI 2, il workflow tipico:
- Clonare il repository ufficiale
arc-prize/ARC-AGI-2e installare le dipendenze Python. - Caricare il modello tramite vLLM o llama.cpp in modalità server compatibile con OpenAI. La documentazione vLLM include i modelli MoE come Qwen 3 235B-A22B.
- Codificare ogni griglia in una stringa ASCII, poi costruire un prompt con esempi few-shot.
- Per il test-time training, isolare una LoRA di rango 16-32 addestrata sulle 2-5 dimostrazioni di ciascun compito (tempo aggiuntivo di 30-90 secondi per compito). La libreria PEFT di HuggingFace copre questo caso d'uso.
- Valutare con lo script
scoring.pyfornito, che calcola pass@1 e pass@2.
I modelli con contesto lungo come MiMo V2.5 Pro (1 M token) o Llama 4 Maverick 400B (1 M token) permettono di inserire molti esempi senza troncamento, il che aiuta nelle attività con regole composte.
Per dimensionare il tuo hardware, il configuratore quelllm.fr calcola la VRAM necessaria in base alla quantizzazione desiderata.
Errori comuni su ARC-AGI 2 e possibili approcci
L'analisi dei tentativi falliti sul repository arc-prize/ARC-AGI-2 rivela tre famiglie di bug ricorrenti nei LLM open-source:
- Allucinazione di colore : il modello inventa un colore assente dalla palette 0-9. Mitigazione: vincolare l'output tramite una grammatica JSON tipizzata (logits processor in vLLM).
- Inversione righe/colonne : confusione tra dimensioni sulle griglie non quadrate. Mitigazione: annotare
H × Lnel prompt. - Sovrageneralizzazione : applicazione di una regola corretta sugli esempi, ma che non coglie la sfumatura del caso di test. Mitigazione: forzare un passaggio
<verification>dopo il chain-of-thought.
Per approcci alternativi, il lavoro del team Greenblatt (sample-then-filter con Claude Sonnet, vedere arXiv:2406.07394) mostra che un modello più piccolo con generazione massiva (1000+ programmi Python sample-and-test) può superare un modello più grande in single-shot. Questa logica si applica bene a Qwen3-Coder-Next 80B-A3B, che eccelle nella sintesi di programmi.
Confronto rapido con ARC-AGI 1
ARC-AGI 1 (2019) era ormai saturo alla fine del 2024, con soluzioni ibride che superavano il 55%. ARC-AGI 2 aumenta nuovamente e deliberatamente la difficoltà con quattro cambiamenti:
- Compiti compositi che combinano da 2 a 4 trasformazioni primitive invece di una sola.
- Griglie più grandi (fino a 30×30 contro 15×15 nella versione v1).
- Eliminazione dei bias statistici che permettevano il brute force per enumerazione.
- Compiti privati rinnovati per il 2025-2026, di cui 50 progettati da esseri umani esperti di ragionamento visivo.
Il risultato: le migliori soluzioni presentate raggiungono al massimo ~30 % nel 2025, mentre superavano il 60 % sulla v1. Per approfondire, vedere anche il guida sugli LLM: ragionamento vs matematica e la pagina DeepSeek R1 vs Ring-1T.
FAQ
Q: Quale modello open-source ottiene il miglior punteggio ARC-AGI 2 alla fine del 2025?
Al momento della stesura, nessuna classifica ufficiale fissa il podio open-source. I risultati inviati dalla comunità collocano DeepSeek R1 671B et Ring-1T in testa grazie al loro chain-of-thought nativo. Le cifre esatte restano da confermare perché la classifica viene aggiornata mensilmente dal team di Arc Prize.
Q: Serve un modello di ragionamento o un modello generalista?
I modelli a ragionamento esplicito (R1, Ring-1T, gpt-oss 120B) superano sistematicamente quelli generalisti con un numero equivalente di parametri. Su ARC-AGI 2, il costo aggiuntivo in token di ragionamento (spesso da ×3 a ×10) è ampiamente compensato dal miglioramento del pass@2. Un Llama 3.3 70B standard rimane limitato rispetto a un DeepSeek R1 Distill Llama 70B.
Q: Qual è la quantità minima di VRAM necessaria per affrontare seriamente il benchmark?
Con 40 GB di VRAM (RTX 6000 Ada o A6000), puoi far girare DeepSeek R1 Distill Llama 70B in Q4 e puntare a un punteggio dignitoso. Per raggiungere la frontiera open-source, bisogna puntare a oltre 250 GB complessivi (multi-GPU o offload aggressivo sulla CPU) per modelli come Qwen 3 235B-A22B.
Q: L'addestramento in fase di test apporta un vantaggio reale?
Senza TTT, il ragionamento LLM si basa esclusivamente sull'inferenza in-context. Con una LoRA rapida addestrata sulle dimostrazioni di ogni compito, si osservano guadagni da 8 a 15 punti percentuali. Il rovescio della medaglia è un costo di calcolo moltiplicato per un fattore da 5 a 10 e una maggiore complessità di implementazione. Per un primo test, limitati al prompting diretto.
Q: Qual è la licenza per uso commerciale?
Preferisci licenze permissive. Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B sono rilasciati con licenza Apache 2.0 o MIT, senza restrizioni sull'uso commerciale. Evita Command R+ 104B con licenza CC-BY-NC 4.0 per un prodotto a pagamento.
Q: Dove trovare i dataset e gli script ufficiali?
Tutto è centralizzato su repository GitHub arc-prize/ARC-AGI-2 e su HuggingFace datasets/arc-prize. Il formato JSON è documentato e stabile dalla prima iterazione del 2019.
Conclusione
Le Benchmark ARC-AGI 2 resterà nel 2026 uno dei pochi test resistenti alla contaminazione e alla memorizzazione, il che lo rende uno strumento prezioso per chi vuole confrontare oggettivamente il ragionamento degli LLM open-source. Prima di avviare una valutazione, dimensiona con precisione le tue GPU con il configuratore quelllm.fr o sfoglia il catalogo completo per individuare il modello più adatto al tuo budget di VRAM e alla licenza desiderata.