Intermedio 12 minEdge

MiniCPM in locale (Ollama): il multimodale compact

Risposta diretta

MiniCPM-V è la serie di modelli compatti di visione e linguaggio di OpenBMB, sotto licenza Apache 2.0. In Ollama, il tag minicpm-v carica ancora la versione 2.6 (8 miliardi, 5,5 GB), minicpm-v4.5 una versione da 8 miliardi di 6,1 GB e minicpm-v4.6 un modello da circa 1,3 miliardi di parametri di 1,6 GB. Inizia dalla versione 4.6 su una macchina di piccole dimensioni, poi confronta i risultati sulle tue immagini.

MiniCPM è la famiglia di modelli compatti di OpenBMB, con modelli di visione e linguaggio pensati per funzionare dove i modelli più grandi non riescono a girare. La famiglia è cambiata molto: la versione caricata dal tag storico di Ollama non è più la più recente e ora esiste un modello da 1,3 miliardi di parametri. Questa pagina indica quale tag installare, come valutare i dati dichiarati e quali sono i limiti dell'OCR di un modello generalista.

Di Samir K.·Agg. 2026-09-29·Testato su Windows, macOS e Linux

#Qual è la versione di MiniCPM da installare nel 2026

MiniCPM-V è la serie di modelli compatti visione-linguaggio di OpenBMB, sviluppata da THUNLP (Università Tsinghua) e ModelBest, i cui pesi e il cui codice sono pubblicati sotto licenza Apache 2.0. In Ollama coesistono tre tag che creano confusione. Il tag minicpm-v, senza suffisso, corrisponde ancora a MiniCPM-V 2.6, un modello da 8 miliardi di parametri che occupa 5,5 GB con 32K di contesto. Il tag minicpm-v4.5 carica una versione più recente da 8 miliardi (6,1 GB, 40K di contesto). Il tag minicpm-v4.6, entrato nella libreria ufficiale di Ollama il 25 giugno 2026 secondo il repository del progetto, occupa 1,6 GB per circa 1,3 miliardi di parametri. Per scoprire la visione in locale su una macchina di piccole dimensioni, inizia con il 4.6; tieni il 4.5 per fare un confronto sui tuoi documenti densi, perché nulla garantisce che un modello da 1,3 miliardi legga bene quanto uno da 8 miliardi quando il testo è fitto.

I tag Ollama della famiglia MiniCPM (schede della libreria, settembre 2026)
Tag OllamaVersioneParametriDownloadContesto annunciatoDa ricordare
minicpm-vMiniCPM-V 2.68 miliardi5,5 GB32KVersione del 2024: supporto per più immagini e video; è quella che viene caricata con il tag senza suffisso
minicpm-v4.5MiniCPM-V 4.58 miliardi6,1 GB40KBasato su Qwen3-8B e SigLIP2-400M; video ad alta frequenza di fotogrammi; il produttore dichiara un punteggio di 77,0 su OpenCompass
minicpm-v4.6MiniCPM-V 4.6circa 1,3 miliardi1,6 GB256KIl più leggero e più recente; compressione dei token visivi; versioni per mobile
openbmb/minicpm-o4.5MiniCPM-o 4.59 miliardi6,1 GB40KVersione omni (voce, flusso in tempo reale); la scheda Ollama indica solo testo e immagine in ingresso
i
Tre nomi da non confondere
MiniCPM-V indica i modelli di visione, MiniCPM-o i modelli omni che aggiungono la voce e il flusso in tempo reale, e MiniCPM 5 la nuova serie di modelli di solo testo per dispositivi (MiniCPM5-1B e MiniCPM5-2B, quest'ultimo con circa 2,5 miliardi di parametri, entrambi disponibili tramite OpenBMB in Ollama). Per l'analisi delle immagini e l'OCR, ti serve MiniCPM-V.

#Cosa offre la serie e cosa va ridimensionato

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La serie punta al miglior rapporto tra capacità e dimensioni. Secondo il repository di OpenBMB, MiniCPM-V 4.5 raggiunge 77,0 su OpenCompass e supera, con 8 miliardi di parametri, GPT-4o-latest, Gemini 2.0 Pro e Qwen2.5-VL 72B. Per la versione 4.6, il progetto indica un encoder visivo il cui carico computazionale si riduce di oltre il 50%, una compressione dei token visivi a scelta (di un fattore 4 o 16) e una velocità di elaborazione dei token pari a circa 1,5 volte quella di Qwen3.5-0.8B. La scheda Ollama dello stesso modello dichiara 2,4 volte: entrambi i valori provengono dal progetto e in queste pagine non viene descritto nel dettaglio alcun protocollo di misurazione. Sono dichiarazioni, non misurazioni indipendenti: cronometra sul tuo hardware.

Multimodale compatto
Testo e immagini, più immagini contemporaneamente e video. La versione 4.5 comprime fino a 6 fotogrammi video in 64 token secondo il repository, permettendo di leggere più immagini senza costi aggiuntivi per il modello linguistico.
OCR ad alta risoluzione
Il 4.5 elabora immagini con qualsiasi rapporto d'aspetto fino a 1,8 milioni di pixel (ad esempio 1344 x 1344). Il produttore afferma che è in testa su OCRBench e nell'analisi dei PDF (OmniDocBench) tra i modelli multimodali generalisti; il 4.6, secondo quanto dichiarato, raggiunge il livello di Qwen3.5 2B su diversi benchmark, tra cui OCRBench.
Licenza permissiva
Il repository dichiara che i pesi e il codice sono sotto licenza Apache 2.0, e le schede Hugging Face delle versioni 4.5 e 4.6 riportano la stessa indicazione. Controlla la licenza esatta della specifica versione che scarichi.
Molti formati
Il progetto offre varianti GGUF, BNB, AWQ e GPTQ e dichiara la compatibilità con SGLang, vLLM, llama.cpp e Ollama.

#Quanta memoria serve davvero

Memoria annunciata da OpenBMB e pesi mostrati da Ollama
Modello e formatoMemoria annunciataFonte
MiniCPM-V 4.6, Transformers (GPU)4 GBTabella dei modelli del repository
MiniCPM-V 4.6, GGUF (CPU)2 GBTabella dei modelli del repository
MiniCPM-V 4.6, BNB, AWQ o GPTQ (GPU)3 GBTabella dei modelli del repository
MiniCPM-o 4.5, GGUF10 GBTabella dei modelli del repository
MiniCPM-o 4.5, GPU19 GBTabella dei modelli del repository
minicpm-v4.6 in Ollama1,6 GB di downloadPagina Ollama
minicpm-v4.5 in Ollama6,1 GB di downloadPagina Ollama

Questi numeri descrivono i pesi e l'esecuzione di base: il contesto e le immagini richiedono ulteriore memoria. Le immagini vengono convertite in token visivi che occupano la finestra di contesto, e la documentazione di Ollama specifica che, con meno di 24 GiB di VRAM, il contesto predefinito è di 4.000 token; aumentare questo valore aumenta la memoria richiesta. Il contesto dichiarato di 256K per la versione 4.6 non viene quindi allocato automaticamente. Infine, la tabella del repository indica l'esecuzione su CPU per la versione GGUF del 4.6, senza riportarne la velocità: effettua delle misurazioni prima di promettere prestazioni in tempo reale.

→
Il trasferimento di parte del modello alla CPU
Se Ollama distribuisce il modello tra GPU e CPU, il comando ollama ps mostra la ripartizione nella colonna PROCESSOR. La causa è spesso l'immagine o il contesto, non i pesi: riduci la risoluzione dell'immagine o il valore di num_ctx prima di passare a una quantizzazione con meno bit.

#Installare MiniCPM-V con Ollama

Ollama gestisce il download, il proiettore visivo e il server API: non c'è nient'altro da installare. Inizia aggiornando Ollama, perché la versione 4.6 è stata aggiunta di recente alla libreria. La pagina del tag minicpm-v indica già che richiedeva Ollama 0.3.10 o successivo.

  1. 01
    Scaricare il modello
    ollama pull minicpm-v4.6 recupera i pesi del modello linguistico e il proiettore visivo, per un totale di circa 1,6 GB. Per la 4.5, usa minicpm-v4.5 (6,1 GB).
  2. 02
    Avviare una prima chat
    ollama run minicpm-v4.6 apre una sessione interattiva. Fai una domanda testuale prima di provare la visione.
  3. 03
    Invia un'immagine
    La documentazione di Ollama mostra il percorso del file posto prima della domanda, ad esempio ollama run minicpm-v4.6 ./photo.jpg seguito da « Descrivi questa immagine ».
  4. 04
    Collegare un'interfaccia
    Una volta scaricato, il modello appare in Open WebUI o in qualsiasi client che punti alla porta 11434.
Terminale
# Le plus léger (1,6 Go)
ollama pull minicpm-v4.6

# La version 8 milliards, pour comparer
ollama pull minicpm-v4.5

# Vérifier ce qui est installé, puis discuter
ollama list
ollama run minicpm-v4.6 ./photo.jpg Décris cette image

#Visione e OCR nell'uso quotidiano

MiniCPM-V se la cava bene nelle attività documentali: leggere una fattura, trascrivere una schermata, estrarre le righe di una tabella, descrivere una foto. Le immagini ad alta risoluzione contano molto nell'OCR, perché un testo in caratteri piccoli, illeggibile in una miniatura, diventa utilizzabile alla risoluzione originale. Formula prompt precisi: «Descrivi questa immagine» produce una descrizione generale, mentre «Trascrivi fedelmente tutto il testo visibile, conservando l'impaginazione» produce un risultato molto più pulito. Per estrarre dati, chiedi un formato esplicito: JSON, Markdown o tabella.

API di Ollama: estrarre i campi da una fattura
import base64, requests

with open("facture.png", "rb") as f:
    img = base64.b64encode(f.read()).decode()

r = requests.post("http://localhost:11434/api/generate", json={
    "model": "minicpm-v4.6",
    "prompt": "Extrais le total, la date et le numéro de facture en JSON.",
    "images": [img],
    "stream": False,
})
print(r.json()["response"])

L'API REST di Ollama richiede l'immagine codificata in base64 nel campo images, come ricorda la sua documentazione; gli SDK accettano inoltre un percorso di file. Se usi Transformers anziché Ollama, il repository documenta un'impostazione utile per la versione 4.6: il parametro downsample_mode vale 16x per impostazione predefinita, mentre 4x conserva quattro volte più token visivi per un dettaglio più fine. È l'impostazione da provare quando un testo con caratteri molto piccoli viene letto male.

!
Verifica sempre l'OCR
Nessun modello di visione compatto è affidabile al 100% su dati numerici critici: importi, riferimenti, date. Un modello di visione può generare un valore ben formato che non compare nella pagina. Per un uso contabile o giuridico, mantieni una revisione umana o un controllo di coerenza sui campi sensibili.

Quando preferire un motore OCR dedicato? Se elabori migliaia di pagine e la tracciabilità ha la priorità, un motore specializzato produce errori visibili invece di valori plausibili. PaddleOCR-VL, un modello con meno di un miliardo di parametri, raggiunge il 96,33% su OmniDocBench v1.6 secondo il suo editore, e Tesseract resta la scelta leggera per testi puliti. MiniCPM-V mantiene il vantaggio quando vuoi anche descrivere l'immagine o rispondere a una domanda su di essa.

#A confronto con Qwen3-VL e gli altri modelli compatti

Il diretto concorrente di MiniCPM-V nella categoria dei modelli di visione compatti è Qwen3-VL, disponibile in Ollama in particolare con 2, 4 e 8 miliardi di parametri. I due coprono lo stesso campo: descrizione di immagini, OCR, domande su un documento. Il README di OpenBMB afferma che MiniCPM-V 4.6 supera in prestazioni un modello più grande, Gemma4-E2B-it, e si dimostra più efficiente di Qwen3.5-0.8B: si tratta di confronti pubblicati dall'editore, su valutazioni fatte da sé.

Modelli di visione compatti disponibili in Ollama
ModelloDimensione mostrataCiò che si può direGuida del sito
minicpm-v4.61,6 GBSecondo il produttore, è al livello di Qwen3.5 2B in diversi benchmark visivi, tra cui OCRBenchQuesta pagina
qwen3-vl:2b1,9 GBStessa classe dimensionale, contesto di 256K indicatoQwen3-VL in locale
qwen3-vl:8b6,1 GBDimensioni equivalenti a minicpm-v4.5Qwen3-VL in locale
MoondreamVedi la guidaModello di visione leggero, trattato in una guida dedicata del sitoMoondream

La scelta dipende più dalle tue immagini che da una scheda tecnica. Le due famiglie funzionano con lo stesso Ollama e la stessa API: passare da una all'altra equivale a cambiare il nome del modello nella richiesta; nulla impedisce di mantenerle entrambe e di instradare le richieste in base al compito.

Confrontare sulla stessa immagine
ollama run minicpm-v4.6 ./ticket.jpg Transcris le texte de ce ticket
ollama run qwen3-vl:2b ./ticket.jpg Transcris le texte de ce ticket

#Edge, mobile e server: ciò che il progetto documenta

MiniCPM è stato progettato per funzionare sul dispositivo. Il repository indica che MiniCPM-V 4.6 può essere distribuito su iOS, Android e HarmonyOS, con il codice di adattamento aperto, e mostra registrazioni dello schermo non modificate su un iPhone 17 Pro Max, un Redmi K70 e un HUAWEI nova 14. Un repository di applicazioni offre il download e la guida alla distribuzione. Per servire più utenti, il progetto annuncia la compatibilità con vLLM e SGLang, oltre a llama.cpp e Ollama.

  1. 01
    Digitalizzazione locale di documenti
    Un mini-PC o un NAS con una GPU di fascia bassa trasforma una cartella di scansioni in testo ricercabile, senza inviare un documento sensibile nel cloud.
  2. 02
    Assistente offline
    Su un portatile Apple Silicon o una scheda modesta, la versione 4.6 legge lo schermo e risponde sulla base di screenshot, anche senza connessione.
  3. 03
    Preprocessing di una pipeline
    A monte di un sistema più pesante, classifica: tipo di documento, campi evidenti. Solo i casi difficili vengono inviati a un modello di grandi dimensioni.
  4. 04
    Testo alternativo in blocco
    Generare descrizioni di immagini per un sito o una mediateca, in batch, senza costi per chiamata una volta ammortizzato l'hardware.
i
MiniCPM-o 4.5: la voce richiede un altro stack
MiniCPM-o 4.5 aggiunge la conversazione vocale e il flusso simultaneo di video e audio, ma la scheda Ollama indica solo testo e immagini in ingresso. Per la voce, il repository rimanda a Transformers o a llama.cpp-omni, e i suoi limiti documentati sono reali: parole talvolta pronunciate male in modalità omni, risposte che talvolta mescolano inglese e cinese.

#Risoluzione dei problemi

Il modello ignora l'immagine
Verifica il percorso del file e che sia accessibile dall'ambiente in cui è in esecuzione Ollama. Tramite API, l'immagine deve essere codificata in base64 nel campo images.
OCR mal eseguito o troncato
L'immagine è probabilmente troppo compressa o ha una risoluzione troppo bassa. Fornisci una versione nitida e più grande e chiedi esplicitamente una trascrizione fedele che mantenga l'impaginazione. Con Transformers, prova downsample_mode 4x.
Risposte lente
Usando solo la CPU, è normale. Su GPU, controlla con ollama ps che il modello non sia stato parzialmente trasferito nella RAM a causa di un contesto o di un'immagine troppo pesanti.
Output non strutturato
Per un JSON affidabile, imponi lo schema nel prompt e, se il tuo client lo consente, usa il formato strutturato di Ollama.
Versione inaspettata
Il tag minicpm-v senza suffisso punta ancora alla versione 2.6. Specifica esplicitamente minicpm-v4.6 o minicpm-v4.5 per un comportamento riproducibile.

#Per approfondire

FAQ
Quale tag Ollama installare per MiniCPM-V?+
Per una macchina poco potente, minicpm-v4.6: circa 1,6 GB e un modello di circa 1,3 miliardi di parametri. Per un confronto con un modello da 8 miliardi di parametri, minicpm-v4.5 pesa 6,1 GB. Attenzione: il tag minicpm-v senza suffisso carica ancora la versione 2.6. Indica sempre la versione, altrimenti non sai cosa stai testando.
MiniCPM-V è gratuito, anche per uso commerciale?+
Il repository annuncia pesi e codice sotto licenza Apache 2.0, e le schede Hugging Face delle versioni 4.5 e 4.6 riportano questa indicazione. Apache 2.0 permette l'uso commerciale. Tuttavia, rileggi attentamente la licenza della versione esatta che stai scaricando, poiché una versione più vecchia potrebbe aver avuto condizioni diverse.
Quanta VRAM serve davvero?+
La tabella del repository indica 4 GB di memoria GPU per il 4.6 con Transformers e 2 GB per la sua versione GGUF su CPU; il 4.5 pesa 6,1 GB in Ollama. Aggiungi il fabbisogno di contesto e immagini: Ollama alloca per impostazione predefinita 4.000 token con meno di 24 GiB di VRAM. Verifica con ollama ps.
MiniCPM-V legge bene il testo dei documenti?+
L'editore annuncia ottimi risultati in OCR, con immagini fino a 1,8 milioni di pixel per la versione 4.5. Si tratta delle sue valutazioni. Come ogni modello di visione, può produrre un valore plausibile che non compare nella pagina: ricontrolla i numeri critici oppure usa un motore OCR dedicato per elaborare grandi volumi.
È possibile usarlo su un telefono?+
Sì, il repository indica che MiniCPM-V 4.6 può essere distribuito su iOS, Android e HarmonyOS, con il codice di adattamento aperto e un repository di applicazioni. Le dimostrazioni pubblicate sono registrazioni dello schermo. Aspettati attività occasionali piuttosto che un flusso continuo di immagini e misura la latenza sul tuo dispositivo.
MiniCPM-o permette di parlare a un modello in Ollama?+
Non secondo la scheda di Ollama, che indica solo testo e immagini in ingresso per minicpm-o4.5. La conversazione vocale e il flusso simultaneo di audio e video passano attraverso Transformers o llama.cpp-omni, secondo il repository. Il modello richiede anche molta più memoria: 19 GB su GPU, 10 GB in GGUF.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.