Migliore LLM open-source per l'educazione e l'insegnamento
Scegliere un LLM open source per l'istruzione significa trovare un equilibrio tra la qualità pedagogica del ragionamento, la capacità di spiegare un concetto passo dopo passo e il contenimento delle risorse hardware imposto dall'implementazione in un istituto o sulla postazione di un insegnante. Il LLM open source per l'istruzione offre un vantaggio decisivo rispetto ai servizi proprietari: controllo dei dati degli studenti, assenza di quote di utilizzo, conformità al RGPD più semplice e costo marginale nullo dopo l'installazione. Questo articolo confronta i modelli aperti più pertinenti per il tutoraggio, la generazione di esercizi, l'aiuto nei compiti, la correzione automatica e la produzione di contenuti pedagogici multilingui, con i loro requisiti di VRAM, licenze e casi d'uso concreti per passare dalla dipendenza da Khanmigo a un tutor locale sovrano.
Quali criteri per un LLM pedagogico?
Un modello destinato all'insegnamento non si sceglie come un modello per la programmazione. Gli aspetti prioritari:
- Ragionamento a più fasi : capacità di scomporre un problema di matematica o di fisica senza saltare passaggi logici. I punteggi AIME e MATH (pubblicati su Papers With Code) sono indicatori utili.
- Conoscenze generali (MMLU) : copertura delle discipline (storia, biologia, economia). I modelli con un punteggio > 80% su MMLU sono candidati seri per l'istruzione secondaria e superiore.
- Qualità del francese : fondamentale per il pubblico francofono. I modelli europei come Mistral Large 3 675B o Apertus 70B (Swiss AI) hanno un vantaggio nativo, proprio come Salamandra 40B Instruct addestrato su corpus multilingui europei.
- Licenza permissiva : Apache 2.0 o MIT per consentire un deployment in ambito accademico senza ostacoli giuridici. La licenza Llama Community impone restrizioni sul numero di utenti attivi mensili.
- Finestra di contesto : per caricare un manuale o più elaborati. Llama 4 Scout 109B annuncia 10 milioni di token di contesto, Seed-OSS 36B Instruct offre 524.288 token.
- Allucinazioni controllate : un tutor che inventa una formula è peggio di un manuale. Preferire i modelli con modalità "ragionamento" esplicita come DeepSeek R1 671B o QwQ 32B.
Per un'analisi più ampia dei criteri di selezione, vedi il guida generale per la scelta di un LLM su quelllm.fr.
Tutoraggio scolastico e per le scuole medie e superiori: i modelli 30-70B
Per una postazione docente dotata di una scheda da 24 GB (RTX 4090, RTX 5090) o di una workstation con due GPU, la classe 30-70B è il punto ottimale. Permette un ragionamento soddisfacente senza saturare la VRAM.
- Qwen 3 32B (Apache 2.0): VRAM Q4 ~19 GB, contesto di 131 072 token. Eccellente in matematica e nel francese scritto, supporto nativo alla catena di pensiero. Profilo dettagliato su HuggingFace Qwen.
- Gemma 4 31B (licenza Gemma) : 18 GB in Q4, 256 000 token di contesto. Risposte ben calibrate per un pubblico scolastico, tono misurato.
- Llama 3.3 70B Instruct (Llama 3.3 Community): 40 GB in Q4. Riferimento assoluto per la cultura generale, punteggio MMLU elevato. Da evitare se l'istituto supera i 700 milioni di utenti attivi mensili — una soglia raramente raggiunta in ambito educativo.
- DeepSeek R2 32B (MIT): 19 GB in Q4, ragionamento esplicito. Buon candidato per aiutare con gli esercizi di matematica, fisica e chimica.
- OLMo 3 32B (Apache 2.0, Allen AI): 19 GB in Q4. Particolarità: modello completamente aperto (pesi + dati + procedura di addestramento), prezioso per un uso accademico in cui la riproducibilità conta. Vedi il repository ufficiale di Allen AI.
- Apertus 70B (Apache 2.0): 40 GB in Q4. Modello multilingue europeo, progettato da Swiss AI in un'ottica di sovranità.
Per un confronto quantitativo, consultare la pagina Qwen 3 32B vs Llama 3.3 70B.
Efficienza nell'uso delle risorse: modelli da 30 a 40B eseguibili su una GPU consumer
Per un liceo dotato di una sola RTX 4090, o un centro di documentazione e informazione (CDI) che condivide una postazione, resta necessario puntare a un fabbisogno di VRAM in Q4 inferiore a 24 GB.
- Qwen 3.6 35B-A3B (Apache 2.0) : 21 GB in Q4, architettura MoE con 3B di parametri attivi. Velocità di inferenza elevata poiché vengono attivati solamente gli esperti rilevanti per ogni token. Ideale per un tutor reattivo in aula.
- Seed-OSS 36B Instruct (Apache 2.0, ByteDance): 22 GB in Q4, contesto di 524.288 token. Permette di analizzare un manuale completo o un lungo elaborato senza suddividerlo.
- Salamandra 40B Instruct (Apache 2.0, Barcelona Supercomputing Center) : 24 GB in Q4. Addestrato specificamente per le lingue europee, tra cui il francese e lo spagnolo. Documentato su HuggingFace BSC-LT.
- Yi 1.5 34B Chat (Apache 2.0, 01.AI) : 20 GB in Q4. Buona versatilità, ma contesto limitato a 4.096 token — da riservare alle interazioni brevi.
Stime dei token al secondo su RTX 4090 in Q4: 35-50 token/s per i modelli densi da 32B, 80-120 token/s per i modelli MoE come Qwen 3.6 35B-A3B. Vedi il benchmark di velocità su quelllm.fr.
Casi d'uso: generare esercizi, correggere elaborati, spiegare un concetto
Generazione di esercizi differenziati. Un insegnante fornisce un obiettivo pedagogico e tre livelli (supporto, standard, approfondimento). Mistral Small 4 (Apache 2.0, 119B, 72 GB in Q4) produce testi degli esercizi ben formulati in francese e rispetta le indicazioni sul livello di difficoltà. Qwen 3.5 122B-A10B (73 GB in Q4) con i suoi 10B attivi offre un ottimo rapporto velocità/qualità per una produzione di massa.
Correzione di elaborati brevi. La funzione-griglia (enunciato + criteri + copia studente) richiede rigorosità. DeepSeek R1 Distill 32B (MIT, 19 GB in Q4) o QwQ 32B (Apache 2.0) gestiscono bene le griglie di valutazione strutturate. Mantenere un insegnante umano nel processo resta necessario per l’assegnazione finale dei voti.
Tutoraggio conversazionale in stile Khanmigo. L'obiettivo è guidare senza dare la risposta. Llama 3.3 70B Instruct et Gemma 4 31B si comportano in modo coerente con la pedagogia socratica. Per una Alternativa a Khanmigo interamente in locale, questi due modelli abbinati a un sistema RAG documentale basato sui programmi ufficiali costituiscono una base solida.
Divulgazione multimodale. Per spiegare uno schema di scienze della vita e della Terra o commentare una figura storica, passare a un modello visione-linguaggio: Qwen 3 VL 235B-A22B (142 GB in Q4) o LLaVA-OneVision 72B (42 GB in Q4) per le istituzioni adeguatamente equipaggiate.
Sovranità, conformità e hosting in un istituto
Il deployment di un tutor IA locale in un istituto scolastico pone tre domande concrete:
- Hosting : un server accademico o comunale, senza flussi di dati in uscita verso un cloud straniero. I modelli con licenza MIT e Apache 2.0 (DeepSeek R2 32B, Mistral Small 4, OLMo 3 32B) non limitano la redistribuzione interna.
- Conformità al RGPD : nessun prompt degli studenti viene esposto a terzi. Il regolamento europeo (EUR-Lex 2016/679) è più semplice da rispettare con un modello on-premise.
- Filtraggio e sicurezza : resta necessario un sistema di moderazione a monte (classificatore, lista nera di prompt). Nessun LLM aperto è intrinsecamente sicuro per un pubblico di minori senza misure di protezione esplicite.
Per esplorare le implicazioni di un'architettura sovrana, vedere il guida al deploy on-premise su quelllm.fr.
FAQ
Q: Quale LLM open source scegliere con un budget per una sola GPU RTX 4090?
Su una sola RTX 4090 (24 GB di VRAM), puntare a Qwen 3 32B o Gemma 4 31B con quantizzazione Q4 (~19 GB) lascia margine per il contesto. Per un migliore rapporto velocità/qualità, Qwen 3.6 35B-A3B con architettura MoE fornisce risposte più veloci grazie ai suoi 3B di parametri attivi.
Q: Esiste una vera alternativa locale a Khanmigo?
Sì. Llama 3.3 70B Instruct o Apertus 70B abbinati a una base documentale RAG (manuali, programmi ufficiali) e a un prompt di sistema pedagogico socratico riproducono la funzione di tutoraggio di Khanmigo, senza trasmettere i dati degli studenti a terzi. Prevedere circa 40 GB di VRAM e una workstation con 2 GPU da 24 GB.
Q: I modelli europei sono sufficienti per il francese scolastico?
Mistral Large 3 675B et Mistral Small 4 (Apache 2.0) eccellono in francese e rispettano le convenzioni tipografiche. Salamandra 40B Instruct (Apache 2.0, BSC) e Apertus 70B (Swiss AI) sono addestrati su corpus multilingue europei con un'elevata proporzione di contenuti in francese — adatti a un utilizzo che garantisca la sovranità digitale.
Q: Qual è la licenza da preferire per un deploy in scuola?
Apache 2.0 e MIT sono le licenze più sicure: nessuna restrizione sull'uso commerciale, nessuna soglia di utenti. La licenza Llama Community impone condizioni oltre i 700 milioni di utenti attivi mensili — raramente vincolanti per un istituto, ma da verificare con l'ufficio legale dell'amministrazione scolastica territoriale.
Q: Serve un modello di «ragionamento» per il tutoraggio matematico?
Per la scuola media, un modello generalista come Gemma 4 31B basta. Per il liceo scientifico e il livello universitario, passare a DeepSeek R1 Distill 32B, QwQ 32B o DeepSeek R2 32B che espongono la loro catena di pensiero. I punteggi AIME pubblicati su HuggingFace Open LLM Leaderboard confermano la loro superiorità nei problemi che richiedono più passaggi.
Q: Come evitare le allucinazioni in un uso pedagogico?
Tre misure cumulabili: (1) collegare il modello a una base RAG dei manuali e dei programmi ufficiali, (2) mostrare sistematicamente la catena di ragionamento quando si usa un modello di ragionamento, (3) definire il prompt di sistema ("se non sei sicuro, dillo esplicitamente"). Nessuna misura isolata elimina gli errori.
Conclusione
La scelta di un LLM open source per l'istruzione dipende dall'hardware disponibile, dalla lingua di destinazione e dal livello di istruzione. Per le scuole secondarie di primo e secondo grado su una singola GPU, Qwen 3 32B, Gemma 4 31B o Qwen 3.6 35B-A3B sono solidi punti di partenza; per un deployment che garantisca la sovranità a livello di un istituto, Mistral Small 4, Apertus 70B o Llama 3.3 70B Instruct offrono una qualità comparabile a quella dei servizi proprietari. Per affinare la scelta in base al tuo hardware specifico, usa il configuratore quelllm.fr o sfoglia il catalogo completo dei 249 modelli.