🇨🇳 Qwen 3.6 27B
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Classifica aggiornata il 09/10/2026
Classifica degli LLM più affidabili per costruire agenti autonomi in locale: precisione nel function calling, robustezza nelle conversazioni a più turni, comprensione degli schemi JSON, contesto sufficiente per mantenere un piano d'azione.
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.
ollama run nemotron-cascade-2
Modello Cohere da 30,5B orientato alla programmazione agentica e al ragionamento. Contesto 488k, Apache 2.0, ~18 GB di VRAM in Q4.
ollama run north-mini-code-1.0
MoE da 35B con 3B attivi, per la programmazione con agenti. 73,4% su SWE-Bench. Uscita il 16 aprile 2026.
ollama run qwen3.6:35b-a3b
MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.
ollama run qwen3:30b-a3b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #4 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License |
| #5 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #6 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
| #7 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 |
Agenti che agiscono sulla tua macchina: Cline agentico, MCP, n8n + Ollama, automazioni locali.
Preferiamo modelli ≥ 7B con contesto ≥ 32k (per mantenere una cronologia delle azioni) e un tag chat o reasoning. Il punteggio favorisce i modelli recenti e quelli di dimensioni medio-grandi (per i quali il function calling diventa affidabile).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Quale LLM per un agente autonomo in locale?
Qwen 3.6 27B è il nostro #1. Mistral Small 3.1 è particolarmente apprezzato per la sua affidabilità nel tool-use e la bassa latenza — un aspetto critico per un agente che effettua 20+ chiamate per compito.
Ollama supporta il function calling?
Sì, dalla versione 0.3.0 tramite il parametro tools. Anche LM Studio e vLLM. Assicurati che il modello sia stato addestrato a farlo (i modelli Mistral, Qwen e Llama recenti lo sono).
Quale framework usare per costruire un agente locale?
LangGraph, CrewAI, AutoGen, Smolagents — tutti configurabili per usare un'istanza locale di Ollama tramite l'endpoint compatibile con OpenAI (http://localhost:11434/v1).
Qual è la differenza tra ragionamento e agenti?
Un modello di ragionamento (DeepSeek R1, QwQ) sviluppa una catena di pensiero prima di rispondere. Un modello agente (Mistral Small, Qwen) sceglie e chiama strumenti esterni. I due possono essere combinati: ragionamento per pianificare, agente per eseguire.