🇺🇸 Laguna XS.2
MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
Classifica aggiornata il 09/10/2026
Classifica dei LLM open-weights specializzati o performanti per la generazione, il refactoring e l'autocompletamento del codice. Si privilegiano i modelli valutati su HumanEval/MBPP, con un contesto ≥ 32k token per coprire interi file, e una licenza permissiva.
⚡ Setup completo che funzionaCline + Aider + Modelfiles configurati, pronto in 30 minuti — Il kit Copilota Locale →MoE 33B/3B attivi, Apache 2.0, specializzato nella programmazione agentica. 68.2% SWE-Bench Verified, 128k ctx. Funziona su un Mac con 36 GB. Uscita il 28 aprile 2026.
ollama run laguna-xs.2
Specialista in programmazione 24B, Apache 2.0. 72.2% su SWE-Bench. 256k ctx, laboratorio francese.
ollama run devstral-small2:24b
MoE 33B / 3B attivi (Poolside), programmazione agentica multilingue. Contesto di 256k, licenza aperta OpenMDW. Funziona su Mac con 43 GB. Uscita a giugno 2026.
ollama run laguna-xs-2.1
MoE 30B (3,3B attivi) specializzato nella programmazione agentica. Molto veloce in locale, 256k ctx nativo, il modello di riferimento per 16-24 GB tramite Ollama.
ollama run qwen3-coder:30b
Modello di riferimento per la programmazione tra quelli a pesi aperti a fine 2024, oggi superato dalla generazione Qwen3-Coder / Devstral.
ollama run qwen2.5-coder:32b
Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Ottimo compromesso in termini di VRAM per la programmazione con modelli self-hosted.
ollama run qwen2.5-coder:14b
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza |
|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 |
| #2 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 |
| #3 | Laguna XS 2.1 | 33B | 19 GB | 256 000 | OpenMDW 1.1 |
| #4 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 2.5 Coder 32B | 32B | 19 GB | 131 072 | Apache 2.0 |
| #6 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 |
| #7 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
Due opzioni in base alla memoria necessaria e al tuo software: Radeon RX 9070 XT 16 GB · GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — confronta l'hardware IA →
Hai il tuo modello. Resta da farlo funzionare nel tuo editor: il kit Copilota Locale lo collega a VS Code con Cline (cap. 7), al terminale con Aider (cap. 8), per l'autocompletamento durante la digitazione (cap. 9) — con il Modelfile impostato per questo modello specifico (cap. 11).
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilota Locale per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtriamo i modelli i cui tag includono «code» e che non superano i 100B (oltre questa soglia non si parla più di «locale»). La classifica combina: specializzazione nella programmazione (il nome contiene «coder», «codestral», «devstral», «laguna»), contesto lungo, licenza permissiva e dimensione ottimale di 7-32B.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Qual è il miglior LLM open-source per programmare nel 2026?
Il nostro #1 è Laguna XS.2 (33B, Apache 2.0). Unisce una precisione elevata su HumanEval, un contesto di 131.072 token e una licenza permissiva.
Quanta VRAM serve per un buon LLM per la programmazione?
Per un modello 7B Coder in Q4_K_M, 6-8 GB di VRAM sono sufficienti. Per un 32B Coder in Q4, prevedi 20-24 GB (RTX 4090, 3090, 7900 XTX). In Q5 o Q8 il fabbisogno aumenta rapidamente — consulta il configuratore.
Posso usarlo in produzione commerciale?
Sì, se la licenza è Apache 2.0 o MIT. Codestral è distribuito con licenza Mistral Non-Production License — solo per uso personale/ricerca. Qwen e DeepSeek sono liberi.
Come integrare un LLM locale in VS Code?
Attraverso l'estensione Cline, che si collega al tuo server locale Ollama o LM Studio. Aider funziona tramite CLI per il refactoring di più file.