Miglior LLM per il supporto tecnico nelle società di servizi informatici (ESN) (IT)

Implementare un'IA locale per il supporto informatico risponde a un vincolo concreto delle aziende di servizi informatici (ESN): ticket, log e runbook contengono dati dei clienti soggetti a clausole di riservatezza. Con un'IA locale per il supporto informatico, questi elementi rimangono su una macchina che controlli e ogni risposta può essere collegata a una fonte.

Questa pagina riguarda esclusivamente il supporto IT interno: qualificazione dei ticket tecnici, lettura dei log depurati dai dati sensibili, ricerca nei runbook, tracciabilità ed escalation. Il commercio, i rimborsi e la traduzione nell'assistenza clienti sono trattati nella guida assistenza clienti multilingue con un LLM locale.

Il piano: criteri di scelta, selezione dei modelli, memoria in base alla quantizzazione, throughput e benchmark, licenze, poi pipeline di deployment.

Ciò che il supporto IT di un'ESN richiede a un modello

Il supporto interno non richiede le stesse qualità di un assistente generalista. Contano quattro criteri:

La selezione: sette modelli tra 68 e 85 GB in Q4

I modelli di seguito sono i più leggeri del catalogo di riferimento di questa pagina. Tutti richiedono un server o una workstation con molta memoria, non il computer di un tecnico.

Due modelli sono limitati dal loro contesto di 32 768 token : dots.llm1 Instruct (142B, MIT, ~85 GB) e DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Sono adatti allo smistamento dei ticket, meno all'analisi dei log.

Per un team dotato di più memoria, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) e MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) costituiscono il livello successivo.

Memoria in base alla quantizzazione e all'hardware

Solo i valori Q4 provengono dal catalogo. Gli altri livelli sono stime di ordine di grandezza basate su regole di proporzionalità, da confermare su ogni scheda.

Per la classe 118B-128B :

Per Mixtral 8x22B Instruct (141B) :

Questi numeri non includono il contesto: caricare 100.000 token di log aggiunge diversi GB di cache. Prevedi un margine di almeno il 15–20% (stima).

Sul piano hardware, un modello Q4 da 72 GB rientra nella memoria di una macchina con 96 GB di memoria unificata, con poco margine, e più comodamente in una con 128 GB. Le pagine Mac 96 GB et Mac 128 GB descrivono in dettaglio queste configurazioni. Su PC, bisogna combinare più schede grafiche: vedi la guida scegliere una GPU per un LLM locale.

Velocità e benchmark: ciò che rimane da confermare

Qui non viene pubblicata alcuna velocità di generazione misurata per questi sette modelli: i token/sec sono da confermare sul tuo hardware. Due riferimenti qualitativi:

Per i punteggi MMLU o HumanEval, consulta l'Open LLM Leaderboard e le schede del catalogo. Questi punteggi devono essere confermati modello per modello e misurano male le attività di assistenza.

Un insieme di dati di test interno è più affidabile: 50 ticket chiusi e anonimizzati, con la categoria, la gravità e la risoluzione reali. Misura il tasso di corretta categorizzazione, il tasso di citazioni esatte del runbook e il numero di escalation non necessarie. La pagina benchmark locale descrive il metodo di misura del throughput.

Licenze: verificare prima di installare presso un cliente

La guida LLM locale in azienda e RGPD completa questo punto per i dati personali presenti nei ticket.

Catena di distribuzione: ticket, log ripuliti dai dati sensibili, runbook, escalation

Un flusso di supporto locale si articola in cinque fasi:

  1. Oscuramento deterministico : uno script sostituisce indirizzi IP, nomi di host, token e indirizzi e-mail con identificatori neutri prima di ogni invio al modello. La tabella di corrispondenza rimane fuori dal modello.
  2. Ricerca nei runbook : le procedure vengono suddivise e indicizzate, poi il modello riceve solo i passaggi pertinenti con il relativo riferimento.
  3. Classificazione : il modello restituisce un JSON con categoria, gravità, ipotesi di causa e fonti citate.
  4. Regola di escalation : ogni risposta senza fonte, ogni incidente di gravità elevata e ogni azione che modifica l'ambiente di produzione vengono affidati a un tecnico.
  5. Registro : ogni scambio è registrato con la versione del modello, la quantizzazione, il prompt e i passaggi utilizzati.

Per l'interfaccia del team, Open WebUI si collega a un server locale. Il manuale distribuire un chatbot di team sull'intranet spiega l'installazione e architettura di un agente locale copre l'invocazione degli strumenti.

FAQ

Q: Questi modelli funzionano sul computer di un tecnico?

No. Il più leggero della selezione, Laguna S 2.1, richiede circa 68 GB in Q4, escluso il contesto. La soluzione realistica è un server condiviso o una workstation con 96-128 GB di memoria, a cui il team accede tramite la rete interna. Per macchine più modeste, il configuratore del sito propone modelli adatti alla memoria disponibile.

Q: Serve affinare il modello sui nostri ticket?

Non come primo passo. La ricerca nei runbook, con citazioni, fornisce già il vocabolario e le procedure dell'ESN senza riaddestramento. Il fine-tuning diventa utile se il formato di output rimane instabile o se le prestazioni di categorizzazione non migliorano più sul tuo set di test. Richiede dati anonimizzati e una verifica della licenza del modello.

Q: Il modello può ripulire autonomamente i log?

Non è consigliato. Un modello può dimenticare di rimuovere un indirizzo IP o un token in un lungo estratto. La rimozione dei dati sensibili deve essere effettuata da uno script deterministico, testato e sottoposto a controllo di versione, collocato prima del modello. Il modello lavora quindi su identificatori neutri e la corrispondenza con i valori reali rimane in un sistema separato.

Q: Il modello può chiudere un ticket da solo?

Meglio evitarlo nella fase iniziale. Il modello propone una classificazione e una possibile soluzione, poi un tecnico le convalida. Dopo alcune settimane di misurazioni, alcune categorie a basso rischio possono essere automatizzate, ad esempio le richieste di documentazione. Gli incidenti in produzione e le azioni che richiedono privilegi restano soggetti a convalida umana.

Q: A quale dimensione minima del contesto puntare per l'analisi dei log?

Punta ad almeno 64.000 token, la capacità offerta da Mixtral 8x22B Instruct, e preferibilmente a 128.000 o più per correlare più file. I modelli con un contesto di 32.768 token obbligano a suddividere gli estratti in parti molto più piccole. Un contesto ampio consuma più memoria e rallenta la generazione: filtra i log prima di inviarli.

Q: Questa selezione include il servizio clienti?

No. Si rivolge al supporto IT interno di una società di servizi informatici: incidenti, log, runbook, escalation. Gli scambi commerciali, i rimborsi e la traduzione delle conversazioni con i clienti finali rispondono ad altri criteri, in particolare la qualità multilingue. Sono trattati nella guida dedicata al supporto clienti multilingue con un LLM locale.

Conclusione

Per un'IA locale di supporto informatico in un'azienda di servizi informatici (ESN), Mistral Small 4 e Qwen 3.5 122B-A10B rappresentano il punto di partenza più sicuro: licenza Apache 2.0, contesto di circa 256.000 token, da 72 a 73 GB in Q4. Le velocità di generazione e i punteggi restano da confermare sul tuo hardware e sui tuoi ticket. Indica la memoria a tua disposizione nel configuratore per verificare la compatibilità, o visita il catalogo per confrontare licenze e requisiti di VRAM.

L'hardware per eseguire un LLM in locale

Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.

Articolo pubblicato e aggiornato il da Mohamed Meguedmi · Fonte dati: /api/models.json · Licenza dei contenuti: CC BY 4.0.

Un errore o un aggiornamento da segnalare? Contribuire.