Miglior LLM open source per il settore medico nel 2026
Scegliere un LLM medico open source nel 2026 richiede di bilanciare la riservatezza dei dati dei pazienti, la precisione clinica e il budget GPU. Il LLM medico open source auto-ospitato resta la soluzione privilegiata per rispettare il RGPD e il segreto professionale, senza trasferire cartelle cliniche a un'API di terzi. Questa guida passa in rassegna i modelli a pesi aperti più pertinenti per gli usi sanitari (sintesi di referti, codifica CIM-10, supporto alla diagnosi differenziale, ricerca bibliografica), con specifiche VRAM, licenze e benchmark verificabili.
Perché un modello auto-ospitato per la salute
I dati personali relativi alla salute rientrano nell'articolo 9 del RGPD e richiedono un hosting HDS in Francia. Un'API cloud, anche crittografata, espone lo studio o l'ospedale a un trasferimento fuori dall'UE e complica l'audit. L'auto-hosting di un modello open-weights su una GPU locale o un server on-premise elimina questo rischio.
Il secondo argomento è la tracciabilità. Un modello con pesi conservati localmente (pesi fissi, prompt di sistema versionato) produce output riproducibili, a differenza di un endpoint proprietario i cui pesi possono cambiare senza preavviso. Per un LLM diagnostico utilizzato a supporto delle decisioni mediche, questa riproducibilità è richiesta per qualificare il dispositivo ai sensi del regolamento MDR 2017/745.
Il progetto MedGemma di Google Health, spesso citato come riferimento, illustra l'approccio: pesi aperti, fine-tuning su corpus medici pubblici (MIMIC, PubMed), valutazione trasparente. Per un panorama più ampio delle famiglie disponibili, vedi il nostro catalogo completo dei 249 modelli indicizzati.
Famiglie di modelli adatte all'uso clinico
Nessun modello generalista è ufficialmente omologato come dispositivo medico nel 2026. La scelta si basa sulla qualità del ragionamento medico misurata dai benchmark MedQA, MedMCQA, PubMedQA e MMLU-Medical, valutata insieme ai vincoli hardware.
Modelli di ragionamento (diagnosi differenziale, sintesi dei casi)
- DeepSeek R1 671B (671B, MIT) — VRAM Q4 ~400 GB, ctx 128 000. Il ragionamento chain-of-thought nativo aiuta nei casi complessi. I punteggi MedQA stimati sono intorno all'88% in pass@1.
- DeepSeek R2 32B (32B, MIT) — VRAM Q4 ~19 GB, ctx 128 000. Versione distillata che gira su una sola RTX 5090, adatta a uno studio o a un servizio ospedaliero.
- QwQ 32B (32B, Apache 2.0) — ragionamento prolungato, ctx 131 072. Prestazioni su MMLU-Medical da confermare dopo una valutazione indipendente.
- DeepSeek R1 Distill 32B (32B, MIT) — alternativa leggera per le strutture senza GPU H100.
Modelli generalisti solidi per la salute
- Llama 3.3 70B Instruct (70B, Llama 3.3 Community) — VRAM Q4 ~40 GB. Ben documentato nella letteratura medica in lingua francese, spesso usato come base per il fine-tuning.
- Mistral Large 3 675B (675B, Apache 2.0) — produttore europeo con sede a Parigi, finestra di contesto di 256.000 token utile per acquisire un dossier completo.
- Mistral Small 4 (119B, Apache 2.0) — VRAM Q4 ~72 GB, buon compromesso per un server 2× A100 80 GB.
- Qwen 3 235B-A22B (235B MoE, Apache 2.0) — architettura mixture-of-experts, 22B parametri attivi, latenza accettabile.
- gpt-oss 120B (117B, Apache 2.0) — modello aperto di OpenAI, ctx 128.000.
Modelli multimodali per l'imaging e i referti scansionati
- Qwen 3 VL 235B-A22B (235B, Apache 2.0) — vision-language, ctx 262 144. Permette di leggere referti in PDF scansionati o grafici.
- LLaVA-OneVision 72B (72B, Apache 2.0) — alternativa accademica documentata su arXiv.
- Molmo 72B (72B, Apache 2.0) — visione open source diAllen AI.
VRAM, quantizzazione e hardware target
Il dimensionamento dell'hardware condiziona ogni deployment diIA locale per la salute. I valori riportati di seguito riguardano l'inferenza, esclusi i batch di addestramento.
Per una postazione individuale (studio di un libero professionista, medico ricercatore) : - Qwen 3.6 35B-A3B — Q4 ~21 GB, entra nella memoria di una RTX 5090 da 32 GB - Granite 4.0 H-Small 32B-A9B — Q4 ~19 GB, licenza Apache 2.0 di IBM Research - Gemma 4 31B — Q4 ~18 GB, licenza Gemma (da leggere prima del deployment clinico) - Seed-OSS 36B Instruct — ctx 524 288, utile per caricare diversi dossier
Per un reparto ospedaliero (da 1 a 2 server DGX o H100) : - Llama 4 Scout 109B — Q4 ~65 GB, contesto di 10 milioni di token (da confermare in produzione) - Mistral Small 4 — Q4 ~72 GB - Qwen 3.5 122B-A10B — Q4 ~73 GB - Mixtral 8x22B Instruct — Q4 ~82 GB, una scelta affidabile per la redazione medica
Per un CHU o un editore sanitario (cluster multi-nodi) : - DeepSeek V3.2 — Q4 ~410 GB - GLM-5.1 — Q4 ~445 GB, ctx 200 000 - Mistral Large 3 675B — Q4 ~405 GB
Le stime per Q5 aggiungono circa il 25% e quelle per FP16 raddoppiano questi volumi. Per una stima più precisa, utilizza il configuratore GPU che tiene conto della cache KV quando la finestra di contesto è piena.
Licenze: cosa è consentito in ambito clinico e cosa pone ostacoli
La licenza determina se puoi integrare il modello in un prodotto fatturato a un istituto sanitario.
- Apache 2.0 (Mistral, Qwen, IBM Granite, gpt-oss, Mixtral): uso commerciale libero, modifiche autorizzate, licenze sui brevetti concesse. La strada più semplice per un dispositivo medico.
- MIT (DeepSeek, MiMo, Ring-1T, GLM) : praticamente equivalente, senza clausola di brevetto esplicita.
- Llama 3 / 3.3 / 4 Community : uso commerciale autorizzato al di sotto della soglia di 700 milioni di utenti attivi mensili, restrizioni su alcuni usi militari. Leggere la licenza ufficiale Meta prima del deploy.
- Gemma (Google): proibisce alcuni usi, clausola di aggiornamento unilaterale delle restrizioni. Più delicato per un prodotto medico certificato.
Per gli operatori europei attenti alla sovranità, Mistral Large 3 675B, Apertus 70B (Swiss AI) e Salamandra 40B Instruct (Barcelona Supercomputing Center) offrono pesi ospitabili integralmente in UE. Confronta queste opzioni sulla pagina Mistral vs Llama.
Benchmark medici: cosa significano i numeri
I benchmark medici pubblici più utilizzati nel 2026:
- MedQA (USMLE) : domande a scelta multipla sul modello dell'esame medico statunitense. Riferimento storico, vedere il paper originale su arXiv.
- MedMCQA : quiz indiano a scelta multipla, ampia copertura delle specialità.
- PubMedQA : ragionamento sugli abstract di PubMed.
- MMLU-Medical : sottoinsieme medico di MMLU.
- MultiMedQA : aggregato pubblicato da Google Research.
I punteggi MedQA dei modelli generalisti in pass@1 (stime tratte dalle schede dei modelli su HuggingFace e dagli articoli tecnici, da confermare per usi critici):
- DeepSeek R1 671B : ~88 %
- Llama 3.3 70B : ~82 %
- Mixtral 8x22B : ~78 %
- Qwen 3 32B : ~80 % (stimato)
Per la programmazione di strumenti per pipeline biomediche (parsing FHIR, script di estrazione di immagini DICOM), Qwen 2.5 Coder 32B o Qwen3-Coder-Next 80B-A3B raggiungono punteggi HumanEval superiori all'85%.
Attenzione : un punteggio elevato nel benchmark MedQA non equivale a un'autorizzazione all'immissione sul mercato. Un dispositivo medico di classe IIa o superiore richiede una validazione clinica conforme alla norma IEC 62304 e al regolamento MDR.
Casi d'uso concreti e pipeline consigliata
Sintesi del referto operatorio : Mistral Small 4 o Llama 3.3 70B, contesto 128.000 token. Prompt strutturato che chiede un riassunto SOAP. Vedi la nostra guida al fine-tuning in ambito sanitario.
Supporto alla codifica CIM-10 e CCAM : Granite 4.0 H-Small con una base RAG costruita sulla nomenclatura ufficiale. IBM pubblica valutazioni su il suo hub Granite.
Ricerca bibliografica PubMed : Qwen 3 VL 235B-A22B per leggere le figure, abbinato a un indice vettoriale. Vedi la guida al RAG medico.
Supporto alla diagnosi differenziale : DeepSeek R1 671B o DeepSeek R2 32B per il ragionamento passo dopo passo. Sempre con validazione umana, come supporto e non come sostituto.
Teleconsulto e trascrizione : combinare Whisper-large-v3 (repo OpenAI) a monte, poi Mistral Large 3 per la formattazione.
Per fare un confronto con altri settori, consulta migliore LLM giuridico o Migliore LLM per il codice.
FAQ
Q: MedGemma è presente su quelllm.fr?
MedGemma non compare ancora nel catalogo dei 249 modelli indicizzati, poiché le varianti specializzate in salute vengono seguite separatamente. Per un deploy immediato, Gemma 4 31B funge da base sotto licenza Gemma, da sottoporre a fine-tuning su un corpus interno. La famiglia MedGemma è documentata da Google Health su HuggingFace e rimane compatibile con un server vLLM standard.
Q: Qual è la quantità minima di VRAM per l'uso clinico da parte di un singolo utente?
Prevedi da 20 a 24 GB per eseguire un modello 32B in Q4 con un contesto di 32 000 token utili. Una RTX 5090 da 32 GB, una RTX 6000 Ada da 48 GB o un Mac Studio M3 Ultra da 96 GB sono adatti. Sotto i 16 GB, sei limitato ai modelli 7B-13B, la cui qualità in ambito medico è giudicata insufficiente per un uso professionale.
Q: È possibile mettere in produzione un LLM medico open source senza certificazione?
Per un uso interno di supporto alla redazione senza incidere sulla decisione medica, sì. Non appena un modulo influenza una diagnosi, una prescrizione o il triage dei pazienti, rientri nell'ambito del regolamento MDR 2017/745. La documentazione ANSM sui dispositivi medici digitali specifica le soglie.
Q: Qual è la differenza tra DeepSeek R1 e R2 per la salute?
DeepSeek R1 671B resta il punto di riferimento per il ragionamento prolungato e la profondità delle conoscenze enciclopediche, ma richiede ~400 GB di VRAM. DeepSeek R2 32B è una versione distillata che funziona su una singola GPU, con circa il 90% delle prestazioni su MedQA secondo i rapporti tecnici disponibili (da confermare).
Q: I modelli cinesi rappresentano un rischio per i dati dei pazienti?
I modelli a pesi aperti (DeepSeek, Qwen, GLM, MiMo) funzionano localmente senza telemetria in uscita. Il rischio non è l'esfiltrazione dei dati, ma il bias culturale sulle patologie, sulla posologia e sui protocolli. È richiesta una valutazione interna su casi francofoni. Confronta con Mistral vs DeepSeek.
Q: Quale modello per la trascrizione medica in francese?
Per la trascrizione grezza, Whisper-large-v3 resta il punto di riferimento. Per trasformare la trascrizione integrale in un resoconto, Mistral Small 4 o Llama 3.3 70B offrono un francese medico naturale. Aggiungi un prompt di sistema che specifica la specialità interessata.
Conclusione
La scelta di un LLM medico open source nel 2026 dipende innanzitutto dall'hardware disponibile e dal quadro normativo di riferimento. Per uno studio, DeepSeek R2 32B o Granite 4.0 H-Small sono sufficienti. Per un CHU, Mistral Large 3 675B o DeepSeek R1 671B coprono casi complessi. Perfeziona la tua selezione con il configuratore GPU o sfoglia il catalogo completo filtrato per licenza e VRAM.