🇨🇳 Qwen 3 VL 30B-A3B
MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.
ollama run qwen3-vl:30b
Classifica aggiornata il 09/10/2026
Classifica degli LLM open-weights in grado di analizzare immagini in ingresso: OCR, descrizione, VQA, analisi di grafici, estrazione di dati da schermate. Tutti ospitabili autonomamente.
MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.
ollama run qwen3-vl:30b
Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).
ollama run gemma4:26b
Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.
ollama run qwen3.8:27b
Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.
ollama run gemma4:31b
Modello vision denso da 8B di Qwen 3. Il miglior VLM compatto della terza generazione di Qwen.
ollama run qwen3-vl:8b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza |
|---|---|---|---|---|---|
| #1 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #2 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #3 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #7 | Qwen 3 VL 8B | 8B | 6 GB | 262 144 | Apache 2.0 |
Hai scelto il tuo modello di visione. Il kit IA Locale dedica un intero capitolo a farlo funzionare correttamente a casa tua: conversare usando immagini in locale, passo dopo passo (cap. 7).
Filtro sul tag «vision». Il punteggio favorisce i modelli recenti (i VLM evolvono molto rapidamente) e quelli di grandi dimensioni (i dettagli fini vengono resi meglio).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Qual è il miglior LLM open-source per analizzare immagini?
Qwen 3 VL 30B-A3B è il nostro #1 per 30B parametri. Per una configurazione più leggera, Qwen 2.5 VL 7B funziona molto bene con 8-12 GB di VRAM.
È possibile fare OCR con questi modelli?
Sì — i VLM moderni sanno leggere il testo nelle immagini (documenti scansionati, screenshot). Per l'OCR su larga scala o industriale, DeepSeek OCR è specializzato. Per il testo manoscritto in francese, preferisci Qwen 2.5 VL, che gestisce bene il francese.
Serve Ollama o llama.cpp per la visione?
Entrambi supportano i modelli di visione (Llama 3.2 Vision, LLaVA, Qwen VL). Anche LM Studio. Usa l'API tramite -images o il parametro images in Ollama.
Quanta VRAM serve per un VLM di qualità discreta?
8 GB per un 7B VL (Qwen 2.5 VL 7B), 12-16 GB per un 11B (Llama 3.2 Vision), 40+ GB per i grandi 72B. La visione aggiunge ~1-2 GB di VRAM oltre al modello testuale.
Approfondisci con i nostri duelli dettagliati tra i finalisti: