Home › Catalogo › Miglior LLM locale con capacità visive nel 2026

Miglior LLM locale con capacità visive nel 2026

◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Classifica aggiornata il 09/10/2026

Classifica degli LLM open-weights in grado di analizzare immagini in ingresso: OCR, descrizione, VQA, analisi di grafici, estrazione di dati da schermate. Tutti ospitabili autonomamente.

Classifica

1

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B parametri · Apache 2.0 · 262 144 token ctx

MoE per la visione con 30B parametri, di cui 3B attivi. Il miglior compromesso per la visione con Qwen 3. 256k di contesto.

Perché questa posizione Supporta nativamente le immagini in input. 30B parametri per un'analisi dettagliata.
ollama run qwen3-vl:30b
VRAM Q4
19 GB
35 GB in Q8
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B parametri · Apache 2.0 · 128 000 token ctx

Variante MoE di Gemma 4. 26B/4B attivi. Multimodale completo (testo+immagine+audio).

Perché questa posizione Supporta nativamente le immagini in ingresso. 26B parametri per un'analisi corretta.
ollama run gemma4:26b
VRAM Q4
16 GB
28 GB in Q8
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B parametri · Apache 2.0 · 8 192 token ctx

Primo dLLM aperto con licenza Apache 2.0: MoE 16B/1B + decoder a diffusione 6.2B. Testo+visione unificati. Uscita il 22 aprile 2026.

Perché questa posizione Supporta nativamente gli input di immagini. 16B parametri per un'analisi corretta.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
VRAM Q4
18 GB
30 GB in Q8
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Modello denso multimodale 27B, uscito il 22 aprile 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Perché questa posizione Supporta nativamente immagini in input. 27B parametri per un'analisi corretta.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB in Q8
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B parametri · Apache 2.0 · 262 144 token ctx

Qwen 3.8 27B: modello denso multimodale (testo + visione), contesto 262k, circa 16 GB di VRAM in Q4 (18 GB di pesi su Ollama). Apache 2.0, programmazione agentica e visione.

Perché questa posizione Supporta nativamente immagini in input. 27B parametri per un'analisi corretta.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB in Q8
6

🇺🇸 Gemma 4 31B

Google · 31B parametri · Apache 2.0 · 256 000 token ctx

Denso 31B multimodale (testo+immagine+audio). 140+ lingue, 256k ctx. #3 Chatbot Arena open.

Perché questa posizione Supporta nativamente le immagini in ingresso. 31B parametri per un'analisi dettagliata.
ollama run gemma4:31b
VRAM Q4
18 GB
33 GB in Q8
7

🇨🇳 Qwen 3 VL 8B

Alibaba · 8 miliardi di parametri · Apache 2.0 · 262 144 token ctx

Modello vision denso da 8B di Qwen 3. Il miglior VLM compatto della terza generazione di Qwen.

Perché questa posizione Supporta nativamente le immagini in ingresso. 8 miliardi di parametri per un'analisi corretta.
ollama run qwen3-vl:8b
VRAM Q4
6 GB
10 GB in Q8

Tabella comparativa

Posizione Modello Params VRAM Q4 Contesto Licenza
#1 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#7 Qwen 3 VL 8B 8B 6 GB 262 144 Apache 2.0
Il kit IA Locale

Hai scelto il tuo modello di visione. Il kit IA Locale dedica un intero capitolo a farlo funzionare correttamente a casa tua: conversare usando immagini in locale, passo dopo passo (cap. 7).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Metodologia della classifica

Filtro sul tag «vision». Il punteggio favorisce i modelli recenti (i VLM evolvono molto rapidamente) e quelli di grandi dimensioni (i dettagli fini vengono resi meglio).

Criteri presi in considerazione:

  • Comprensione dell'immagine
  • OCR / estrazione del testo
  • VQA (domande su immagini)
  • Compatibile con Ollama / llama.cpp

Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.

Domande frequenti

Qual è il miglior LLM open-source per analizzare immagini?

Qwen 3 VL 30B-A3B è il nostro #1 per 30B parametri. Per una configurazione più leggera, Qwen 2.5 VL 7B funziona molto bene con 8-12 GB di VRAM.

È possibile fare OCR con questi modelli?

Sì — i VLM moderni sanno leggere il testo nelle immagini (documenti scansionati, screenshot). Per l'OCR su larga scala o industriale, DeepSeek OCR è specializzato. Per il testo manoscritto in francese, preferisci Qwen 2.5 VL, che gestisce bene il francese.

Serve Ollama o llama.cpp per la visione?

Entrambi supportano i modelli di visione (Llama 3.2 Vision, LLaVA, Qwen VL). Anche LM Studio. Usa l'API tramite -images o il parametro images in Ollama.

Quanta VRAM serve per un VLM di qualità discreta?

8 GB per un 7B VL (Qwen 2.5 VL 7B), 12-16 GB per un 11B (Llama 3.2 Vision), 40+ GB per i grandi 72B. La visione aggiunge ~1-2 GB di VRAM oltre al modello testuale.

Confronti uno contro uno

Approfondisci con i nostri duelli dettagliati tra i finalisti:

Per approfondire

I kit QuelLLM La guida di riferimento per ogni uso
Tutti i kit a vita — 49 €