Home › Catalogo › Miglior LLM locale per agenti / tool-use nel 2026

Miglior LLM locale per agenti / tool-use nel 2026

◆ Agenti locali — agenti che agiscono sulla tua macchina, senza cloud · 24 € · o tutti i kit a 49 € →

Classifica aggiornata il 09/10/2026

Classifica degli LLM più affidabili per costruire agenti autonomi in locale: precisione nel function calling, robustezza nelle conversazioni a più turni, comprensione degli schemi JSON, contesto sufficiente per mantenere un piano d'azione.

Classifica

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Perché questa posizione Function calling affidabile, 262.144 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento come vantaggio aggiuntivo.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB in Q8
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.

Perché questa posizione Function calling affidabile, 262.144 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento come vantaggio aggiuntivo.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB in Q8
3

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B parametri · MIT · 128 000 token ctx

GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.

Perché questa posizione Function calling affidabile, 128.000 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento in più.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB in Q8
4

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B parametri · NVIDIA Open Model License · 128 000 token ctx

MoE 30B/3B attivi: thinking mode + instruct. Medaglia d'oro a IMO 2025 e IOI 2025. Inferenza rapida grazie ai 3B attivi, capacità di ragionamento di livello 30B. Uscita ad aprile 2026.

Perché questa posizione Function calling affidabile, 128.000 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento in più.
ollama run nemotron-cascade-2
VRAM Q4
17 GB
32 GB in Q8
5

🇺🇸 North Mini Code 1.0

Cohere · 30,5 miliardi di parametri · Apache 2.0 · 488 000 token ctx

Modello Cohere da 30,5B orientato alla programmazione agentica e al ragionamento. Contesto 488k, Apache 2.0, ~18 GB di VRAM in Q4.

Perché questa posizione Function calling affidabile, 488 000 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento come vantaggio aggiuntivo.
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33 GB in Q8
6

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35 miliardi di parametri · Apache 2.0 · 262 000 token ctx

MoE da 35B con 3B attivi, per la programmazione con agenti. 73,4% su SWE-Bench. Uscita il 16 aprile 2026.

Perché questa posizione Function calling affidabile, 262.000 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento come vantaggio aggiuntivo.
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
38 GB in Q8
7

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B parametri · Apache 2.0 · 131 072 token ctx

MoE 30B/3B attivi con ragionamento ibrido. MMLU 81.4, AIME24 80.4. 100+ lingue.

Perché questa posizione Function calling affidabile, 131.072 token di contesto per conservare la cronologia delle azioni. Capacità di ragionamento come vantaggio aggiuntivo.
ollama run qwen3:30b-a3b
VRAM Q4
19 GB
35 GB in Q8

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#4 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License
#5 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#6 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
#7 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0
Il kit Agenti Locali

Agenti che agiscono sulla tua macchina: Cline agentico, MCP, n8n + Ollama, automazioni locali.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Metodologia della classifica

Preferiamo modelli ≥ 7B con contesto ≥ 32k (per mantenere una cronologia delle azioni) e un tag chat o reasoning. Il punteggio favorisce i modelli recenti e quelli di dimensioni medio-grandi (per i quali il function calling diventa affidabile).

Criteri presi in considerazione:

  • Chiamata di funzioni precisa
  • Contesto ≥ 32k token
  • Affidabilità su più turni
  • Formato JSON rispettato

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

Quale LLM per un agente autonomo in locale?

Qwen 3.6 27B è il nostro #1. Mistral Small 3.1 è particolarmente apprezzato per la sua affidabilità nel tool-use e la bassa latenza — un aspetto critico per un agente che effettua 20+ chiamate per compito.

Ollama supporta il function calling?

Sì, dalla versione 0.3.0 tramite il parametro tools. Anche LM Studio e vLLM. Assicurati che il modello sia stato addestrato a farlo (i modelli Mistral, Qwen e Llama recenti lo sono).

Quale framework usare per costruire un agente locale?

LangGraph, CrewAI, AutoGen, Smolagents — tutti configurabili per usare un'istanza locale di Ollama tramite l'endpoint compatibile con OpenAI (http://localhost:11434/v1).

Qual è la differenza tra ragionamento e agenti?

Un modello di ragionamento (DeepSeek R1, QwQ) sviluppa una catena di pensiero prima di rispondere. Un modello agente (Mistral Small, Qwen) sceglie e chiama strumenti esterni. I due possono essere combinati: ragionamento per pianificare, agente per eseguire.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €