Miglior LLM per il supporto tecnico nelle società di servizi informatici (ESN) (IT)
Implementare un'IA locale per il supporto informatico risponde a un vincolo concreto delle aziende di servizi informatici (ESN): ticket, log e runbook contengono dati dei clienti soggetti a clausole di riservatezza. Con un'IA locale per il supporto informatico, questi elementi rimangono su una macchina che controlli e ogni risposta può essere collegata a una fonte.
Questa pagina riguarda esclusivamente il supporto IT interno: qualificazione dei ticket tecnici, lettura dei log depurati dai dati sensibili, ricerca nei runbook, tracciabilità ed escalation. Il commercio, i rimborsi e la traduzione nell'assistenza clienti sono trattati nella guida assistenza clienti multilingue con un LLM locale.
Il piano: criteri di scelta, selezione dei modelli, memoria in base alla quantizzazione, throughput e benchmark, licenze, poi pipeline di deployment.
Ciò che il supporto IT di un'ESN richiede a un modello
Il supporto interno non richiede le stesse qualità di un assistente generalista. Contano quattro criteri:
- Finestra di contesto : un estratto di log, un runbook e la cronologia di un ticket superano rapidamente i 30.000 token. I modelli limitati a 4.096 token (Snowflake Arctic Instruct) o 8.192 token (Grok-1 (base)) sono esclusi per questo uso.
- Output strutturato : il modello deve produrre un JSON stabile (categoria, gravità, team destinatario) che lo strumento di gestione dei ticket possa elaborare.
- Fideltà alle fonti : la risposta deve citare il runbook o la riga di log utilizzata, altrimenti la tracciabilità viene persa.
- Licenza : il modello viene spesso eseguito nell'ambito di un servizio fatturato, quindi per uso commerciale.
La selezione: sette modelli tra 68 e 85 GB in Q4
I modelli di seguito sono i più leggeri del catalogo di riferimento di questa pagina. Tutti richiedono un server o una workstation con molta memoria, non il computer di un tecnico.
- Mistral Small 4 : 119B, Apache 2.0, ~72 GB in Q4, contesto 256.000. Prima scelta predefinita grazie alla sua licenza permissiva e al suo ampio contesto. Pesi sulla pagina Hugging Face di Mistral.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, ~73 GB in Q4, contesto 262.000. Il suffisso A10B indica circa 10 miliardi di parametri attivi per token, il che favorisce il throughput. Vedi Alibaba su Hugging Face.
- Nemotron 3 Super 120B : 120B, NVIDIA Open Model License, ~72 GB in Q4, contesto 128.000. Adatto a un'infrastruttura già dotata di hardware NVIDIA (NVIDIA su Hugging Face).
- Laguna S 2.1 : 118B, OpenMDW 1.1, ~68 GB in Q4, contesto 262 144. Il più leggero della selezione, orientato al codice, utile per i ticket riguardanti script e pipeline.
- Qwen3.8 Flash Next 125B-A6B : 125B, licenza « Altro (open weights) », ~72 GB in Q4, contesto 256 000. Licenza da leggere prima di qualsiasi utilizzo presso un cliente.
- Mistral Medium 3.5 128B : 128B, Modified MIT, ~74 GB in Q4, contesto 256 000.
- Mixtral 8x22B Instruct : 141B, Apache 2.0, ~82 GB in Q4, contesto 64.000. Contesto più breve, sufficiente per un ticket e un runbook, al limite per lunghi estratti di log.
Due modelli sono limitati dal loro contesto di 32 768 token : dots.llm1 Instruct (142B, MIT, ~85 GB) e DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Sono adatti allo smistamento dei ticket, meno all'analisi dei log.
Per un team dotato di più memoria, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) e MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) costituiscono il livello successivo.
Memoria in base alla quantizzazione e all'hardware
Solo i valori Q4 provengono dal catalogo. Gli altri livelli sono stime di ordine di grandezza basate su regole di proporzionalità, da confermare su ogni scheda.
Per la classe 118B-128B :
- Q4 : da 68 a 74 GB (catalogo)
- Q5 : circa 82–90 GB (stima)
- Q8 : da circa 120 a 135 GB (stima)
- FP16 : circa 236–256 GB (stima)
Per Mixtral 8x22B Instruct (141B) :
- Q4 : ~82 GB (catalogo)
- Q5 : ~97 GB (stimato)
- Q8 : ~150 GB (stimato)
- FP16 : ~282 GB (stimato)
Questi numeri non includono il contesto: caricare 100.000 token di log aggiunge diversi GB di cache. Prevedi un margine di almeno il 15–20% (stima).
Sul piano hardware, un modello Q4 da 72 GB rientra nella memoria di una macchina con 96 GB di memoria unificata, con poco margine, e più comodamente in una con 128 GB. Le pagine Mac 96 GB et Mac 128 GB descrivono in dettaglio queste configurazioni. Su PC, bisogna combinare più schede grafiche: vedi la guida scegliere una GPU per un LLM locale.
Velocità e benchmark: ciò che rimane da confermare
Qui non viene pubblicata alcuna velocità di generazione misurata per questi sette modelli: i token/sec sono da confermare sul tuo hardware. Due riferimenti qualitativi:
- Architettura MoE : a parità di dimensioni, un modello con un numero ridotto di parametri attivi (A6B, A10B) legge meno dati per token e genera più velocemente di un modello denso.
- Concorrenza : un team di supporto invia più richieste contemporaneamente. Un server come vLLM gestisce le richieste in batch e aumenta il throughput complessivo, mentre llama.cpp resta la soluzione più semplice per un flusso unico in GGUF.
Per i punteggi MMLU o HumanEval, consulta l'Open LLM Leaderboard e le schede del catalogo. Questi punteggi devono essere confermati modello per modello e misurano male le attività di assistenza.
Un insieme di dati di test interno è più affidabile: 50 ticket chiusi e anonimizzati, con la categoria, la gravità e la risoluzione reali. Misura il tasso di corretta categorizzazione, il tasso di citazioni esatte del runbook e il numero di escalation non necessarie. La pagina benchmark locale descrive il metodo di misura del throughput.
Licenze: verificare prima di installare presso un cliente
- Apache 2.0 (Mistral Small 4, Qwen 3.5 122B-A10B, Mixtral 8x22B Instruct): uso commerciale consentito, mantenendo gli avvisi di licenza.
- MIT (dots.llm1 Instruct) : uso commerciale consentito, vincoli minimi.
- Modified MIT (Mistral Medium 3.5 128B): le clausole aggiunte sono da leggere, le condizioni da confermare.
- NVIDIA Open Model License, OpenMDW 1.1, Databricks Open Model License : licenze specifiche dei fornitori, da far revisionare prima del deployment nell'ambito di servizi per i clienti.
- Altro (open weights) (Qwen3.8 Flash Next 125B-A6B) : condizioni da confermare caso per caso.
La guida LLM locale in azienda e RGPD completa questo punto per i dati personali presenti nei ticket.
Catena di distribuzione: ticket, log ripuliti dai dati sensibili, runbook, escalation
Un flusso di supporto locale si articola in cinque fasi:
- Oscuramento deterministico : uno script sostituisce indirizzi IP, nomi di host, token e indirizzi e-mail con identificatori neutri prima di ogni invio al modello. La tabella di corrispondenza rimane fuori dal modello.
- Ricerca nei runbook : le procedure vengono suddivise e indicizzate, poi il modello riceve solo i passaggi pertinenti con il relativo riferimento.
- Classificazione : il modello restituisce un JSON con categoria, gravità, ipotesi di causa e fonti citate.
- Regola di escalation : ogni risposta senza fonte, ogni incidente di gravità elevata e ogni azione che modifica l'ambiente di produzione vengono affidati a un tecnico.
- Registro : ogni scambio è registrato con la versione del modello, la quantizzazione, il prompt e i passaggi utilizzati.
Per l'interfaccia del team, Open WebUI si collega a un server locale. Il manuale distribuire un chatbot di team sull'intranet spiega l'installazione e architettura di un agente locale copre l'invocazione degli strumenti.
FAQ
Q: Questi modelli funzionano sul computer di un tecnico?
No. Il più leggero della selezione, Laguna S 2.1, richiede circa 68 GB in Q4, escluso il contesto. La soluzione realistica è un server condiviso o una workstation con 96-128 GB di memoria, a cui il team accede tramite la rete interna. Per macchine più modeste, il configuratore del sito propone modelli adatti alla memoria disponibile.
Q: Serve affinare il modello sui nostri ticket?
Non come primo passo. La ricerca nei runbook, con citazioni, fornisce già il vocabolario e le procedure dell'ESN senza riaddestramento. Il fine-tuning diventa utile se il formato di output rimane instabile o se le prestazioni di categorizzazione non migliorano più sul tuo set di test. Richiede dati anonimizzati e una verifica della licenza del modello.
Q: Il modello può ripulire autonomamente i log?
Non è consigliato. Un modello può dimenticare di rimuovere un indirizzo IP o un token in un lungo estratto. La rimozione dei dati sensibili deve essere effettuata da uno script deterministico, testato e sottoposto a controllo di versione, collocato prima del modello. Il modello lavora quindi su identificatori neutri e la corrispondenza con i valori reali rimane in un sistema separato.
Q: Il modello può chiudere un ticket da solo?
Meglio evitarlo nella fase iniziale. Il modello propone una classificazione e una possibile soluzione, poi un tecnico le convalida. Dopo alcune settimane di misurazioni, alcune categorie a basso rischio possono essere automatizzate, ad esempio le richieste di documentazione. Gli incidenti in produzione e le azioni che richiedono privilegi restano soggetti a convalida umana.
Q: A quale dimensione minima del contesto puntare per l'analisi dei log?
Punta ad almeno 64.000 token, la capacità offerta da Mixtral 8x22B Instruct, e preferibilmente a 128.000 o più per correlare più file. I modelli con un contesto di 32.768 token obbligano a suddividere gli estratti in parti molto più piccole. Un contesto ampio consuma più memoria e rallenta la generazione: filtra i log prima di inviarli.
Q: Questa selezione include il servizio clienti?
No. Si rivolge al supporto IT interno di una società di servizi informatici: incidenti, log, runbook, escalation. Gli scambi commerciali, i rimborsi e la traduzione delle conversazioni con i clienti finali rispondono ad altri criteri, in particolare la qualità multilingue. Sono trattati nella guida dedicata al supporto clienti multilingue con un LLM locale.
Conclusione
Per un'IA locale di supporto informatico in un'azienda di servizi informatici (ESN), Mistral Small 4 e Qwen 3.5 122B-A10B rappresentano il punto di partenza più sicuro: licenza Apache 2.0, contesto di circa 256.000 token, da 72 a 73 GB in Q4. Le velocità di generazione e i punteggi restano da confermare sul tuo hardware e sui tuoi ticket. Indica la memoria a tua disposizione nel configuratore per verificare la compatibilità, o visita il catalogo per confrontare licenze e requisiti di VRAM.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.