Home › Catalogo › Miglior LLM locale per RAG nel 2026

Miglior LLM locale per RAG nel 2026

◆ RAG Locale — I tuoi documenti interrogati da un'IA locale, senza cloud · 24 € · o tutti i kit a 49 € →

Classifica aggiornata il 09/10/2026

Classifica degli LLM più adatti al RAG: finestra di contesto lunga (≥ 32k token per elaborare diversi documenti), qualità di sintesi sulle fonti fornite, robustezza ai 'distrattori' (informazioni non rilevanti nel prompt).

Classifica

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Perché questa posizione Contesto di 262.144 token — eccellente per grandi corpus. 27B parametri per una sintesi di qualità.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB in Q8
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.

Perché questa posizione Contesto di 262.144 token — eccellente per grandi corpus. 27B parametri per una sintesi di qualità.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB in Q8
3

🇺🇸 North Mini Code 1.0

Cohere · 30,5 miliardi di parametri · Apache 2.0 · 488 000 token ctx

Modello Cohere da 30,5B orientato alla programmazione agentica e al ragionamento. Contesto 488k, Apache 2.0, ~18 GB di VRAM in Q4.

Perché questa posizione Contesto di 488.000 token — eccellente per grandi corpus. 30,5 miliardi di parametri per una sintesi di qualità.
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33 GB in Q8
4

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B parametri · Apache 2.0 · 128 000 token ctx

Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).

Perché questa posizione Contesto di 128.000 token — eccellente per grandi corpus. 26 miliardi di parametri per una sintesi di qualità.
ollama run gemma4:26b
VRAM Q4
16 GB
28 GB in Q8
5

🇺🇸 Gemma 4 31B

Google · 31B parametri · Apache 2.0 · 256 000 token ctx

Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.

Perché questa posizione Contesto di 256.000 token — eccellente per grandi corpus. 31B parametri per una sintesi di qualità.
ollama run gemma4:31b
VRAM Q4
18 GB
33 GB in Q8
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B parametri · MIT · 128 000 token ctx

GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.

Perché questa posizione Contesto di 128.000 token — eccellente per grandi corpus. 31B parametri per una sintesi di qualità.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB in Q8
7

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35 miliardi di parametri · Apache 2.0 · 262 000 token ctx

MoE da 35B con 3B attivi, per la programmazione con agenti. 73,4% su SWE-Bench. Uscita il 16 aprile 2026.

Perché questa posizione Contesto di 262.000 token — eccellente per grandi corpus. 35 miliardi di parametri per una sintesi di qualità.
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
38 GB in Q8

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#4 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#5 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#7 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
Il kit RAG Locale

I tuoi documenti, la tua IA: un RAG locale affidabile sui tuoi PDF, sulle tue note e sulle tue email — senza inviare nulla nel cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Metodologia della classifica

Si mantengono i modelli per chat o uso generale con un contesto di almeno 32k token (necessario per un chunking utile). Il punteggio favorisce i modelli recenti, con un'ampia finestra di contesto e una licenza permissiva (distribuzione in azienda).

Criteri presi in considerazione:

  • Contesto ≥ 32k token
  • Qualità di sintesi
  • Robustezza ai distrattori
  • Licenza libera

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

Quale dimensione del contesto serve per un buon RAG?

Minimo 32k token per gestire 5-10 blocchi di circa 2k token + prompt. Ideale: 128k token (Qwen 3.6 27B ne ha 262.144), per gestire documenti interi senza chunking aggressivo.

Quale modello per il RAG con 24 GB di VRAM (RTX 4090)?

Mistral Small 3.1 24B in Q4_K_M o Qwen 2.5 32B in Q4 rientrano in 24 GB. Per Llama 3.3 70B bisogna scendere a Q2/Q3 o aggiungere una seconda scheda.

Quale embedding abbinare a questi LLM?

Per il francese : BGE-M3, multilingual-e5-large, o gli embedding Mistral. Vedi la guida embeddings FR.

Qual è lo stack RAG locale da preferire?

Ollama (server LLM) + ChromaDB o Qdrant (vector store) + LlamaIndex o LangChain (orchestrazione). Vedere il guida completa.

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €