🇨🇳 Qwen 3.6 27B
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Classifica aggiornata il 09/10/2026
Classifica degli LLM più adatti al RAG: finestra di contesto lunga (≥ 32k token per elaborare diversi documenti), qualità di sintesi sulle fonti fornite, robustezza ai 'distrattori' (informazioni non rilevanti nel prompt).
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
Modello Cohere da 30,5B orientato alla programmazione agentica e al ragionamento. Contesto 488k, Apache 2.0, ~18 GB di VRAM in Q4.
ollama run north-mini-code-1.0
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.
ollama run gemma4:31b
GLM-4.7-Flash (MoE 31B, ~3B attivi): il miglior rapporto codice/VRAM della classe 30B. MIT, 128k ctx, molto veloce su 3090/4090.
ollama run glm-4.7-flash
MoE da 35B con 3B attivi, per la programmazione con agenti. 73,4% su SWE-Bench. Uscita il 16 aprile 2026.
ollama run qwen3.6:35b-a3b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #4 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #5 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #6 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #7 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
I tuoi documenti, la tua IA: un RAG locale affidabile sui tuoi PDF, sulle tue note e sulle tue email — senza inviare nulla nel cloud.
Si mantengono i modelli per chat o uso generale con un contesto di almeno 32k token (necessario per un chunking utile). Il punteggio favorisce i modelli recenti, con un'ampia finestra di contesto e una licenza permissiva (distribuzione in azienda).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Quale dimensione del contesto serve per un buon RAG?
Minimo 32k token per gestire 5-10 blocchi di circa 2k token + prompt. Ideale: 128k token (Qwen 3.6 27B ne ha 262.144), per gestire documenti interi senza chunking aggressivo.
Quale modello per il RAG con 24 GB di VRAM (RTX 4090)?
Mistral Small 3.1 24B in Q4_K_M o Qwen 2.5 32B in Q4 rientrano in 24 GB. Per Llama 3.3 70B bisogna scendere a Q2/Q3 o aggiungere una seconda scheda.
Quale embedding abbinare a questi LLM?
Per il francese : BGE-M3, multilingual-e5-large, o gli embedding Mistral. Vedi la guida embeddings FR.
Qual è lo stack RAG locale da preferire?
Ollama (server LLM) + ChromaDB o Qdrant (vector store) + LlamaIndex o LangChain (orchestrazione). Vedere il guida completa.