Migliore LLM per il servizio clienti nel retail e nell'e-commerce

Implementare un'IA locale per il servizio clienti nell'e-commerce significa eseguire un LLM sulle tue macchine per rispondere ai clienti di un negozio online senza inviare il catalogo, gli ordini o gli indirizzi postali a un servizio terzo. Il modello giusto per questa IA locale dedicata all'e-commerce non è il più grande né quello meglio classificato in un benchmark generalista: è quello che legge correttamente una scheda prodotto, indica lo stato corretto dell'ordine, applica alla lettera la politica di reso e passa la gestione a una persona quando non sa rispondere. Questo articolo illustra le quattro attività da coprire, propone una selezione per fascia hardware nel catalogo quelllm.fr, descrive un protocollo di valutazione dell'aderenza ai dati, poi passa in rassegna licenze e deployment prima di una FAQ.

I quattro compiti di un LLM per il servizio clienti nell'e-commerce

L'ambito è volutamente limitato. Il supporto multilingue è trattato nel guida dedicata al supporto clienti multilingue in locale e il supporto informatico interno non è trattato qui. Restano quattro funzioni che definiscono le specifiche dei requisiti:

La capacità che differenzia i modelli è quindi l'ancrage : rispondere in base ai dati forniti e rifiutare in modo chiaro quando manca l'informazione. L'architettura consigliata (ricerca documentale, chiamate a strumenti, regole di rifiuto) è descritta nel guida all'architettura di un agente locale.

Selezione per Mac con 128 GB e workstation con due GPU (Q4 tra 68 e 75 GB)

Questo livello corrisponde a un Mac Studio con 128 GB di memoria unificata o a una workstation con una scheda professionale da 96 GB. I modelli qui sotto hanno architetture a esperti (MoE): pochi parametri attivi per token, quindi una velocità di generazione compatibile con una chat in tempo reale nonostante le dimensioni dei pesi. Tutti i valori di velocità di generazione sono stime derivate dal numero di parametri attivi e dalla larghezza di banda della memoria, da confermare sulla tua macchina.

Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parametri : 122B in totale, circa 10B attivi per token - VRAM Q4 : ~73 GB ; Q5 ~88 GB (stimato) ; Q8 ~130 GB (stimato) ; FP16 ~245 GB (stimato) - Contesto : 262.000 token, ampiamente sufficienti per una politica di reso completa, una cronologia della conversazione e una decina di schede prodotto - Velocità di elaborazione : da 30 a 45 token/s stimati su Mac Studio M4 Max 128 GB in Q4; 80 token/s o più stimati su una scheda da 96 GB con vLLM - Perché sceglierlo per l'e-commerce : la famiglia Qwen segue bene le istruzioni sul formato e le chiamate agli strumenti, un aspetto importante per gli stati degli ordini. Pesi pubblicati da Alibaba su Hugging Face.

Mistral Small 4 (Mistral, Apache 2.0) - Parametri : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (stima); FP16 ~240 GB (stima) - Contesto : 256 000 token - Velocità di elaborazione : da confermare in base al numero di parametri attivi dell'architettura; considera un ordine di grandezza simile a quello precedente se il modello è MoE - Perché sceglierlo per l'e-commerce : qualità del francese nella scrittura di testi destinati ai clienti, licenza Apache 2.0 senza clausola commerciale. Pesi pubblicati da Mistral su Hugging Face.

Qwen3.8 Flash Next 125B-A6B (Qwen, licenza open weights, termini da verificare prima dell'uso commerciale) - Parametri : 125B in totale, circa 6B attivi - VRAM Q4 : ~72 GB ; Q8 ~133 GB (stimato) - Contesto : 256 000 token - Velocità di elaborazione : il più veloce della fascia, da 50 a 70 token/s stimati su Mac Studio 128 GB - Perché sceglierlo per l'e-commerce : latenza bassa per una chat con molto traffico. Il rovescio della medaglia: meno parametri attivi, quindi da testare con attenzione sulle domande ambigue.

Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (stimato) - Contesto : 256 000 token - Perché sceglierlo per l'e-commerce : alternativa a Mistral Small 4 quando vuoi un livello di ragionamento in più nei casi di controversia, a scapito di una velocità di generazione inferiore (da confermare).

Per scegliere la macchina, la pagina dedicata ai Mac da 128 GB elenca i modelli che rientrano effettivamente nella memoria disponibile anche con il contesto.

Livello server: 140 GB e oltre

Se disponi di un server con più schede o di una macchina da 192 GB o più, tre modelli offrono un vantaggio qualitativo nei casi complessi (reclami in più fasi, ordini parzialmente spediti).

I modelli oltre i 400 GB del catalogo (DeepSeek V4 Pro, Kimi K3, GLM 5.2) sono fuori portata per un deploy in negozio e non offrono un vantaggio misurabile su compiti così ben definiti.

Valutare l'ancoraggio e il rifiuto: il protocollo che conta

I benchmark pubblici (MMLU, HumanEval, AIME) misurano la cultura generale, il codice o la matematica. Nessuno misura «il modello ha inventato un termine per il reso?». Il Open LLM Leaderboard serve a escludere un modello debole, non a sceglierne uno per questo caso d'uso. Crea il tuo set di test: basta mezza giornata:

Per il livello di ricerca documentale, la guida Firecrawl e RAG locale mostra come creare l'indice del catalogo; il guida GraphRAG tratta il caso dei cataloghi con molte relazioni tra prodotti.

Licenze e dati clienti

Un servizio clienti tratta dati personali: nome, indirizzo, cronologia degli acquisti. Il deployment locale elimina il trasferimento a un fornitore esterno incaricato del trattamento, ma restano due punti da definire.

Deployment: motore, interfaccia, latenza obiettivo

Le guida al deployment di un chatbot di team su intranet copre la procedura di avvio passo dopo passo.

FAQ

Q: Quale modello scegliere per iniziare con un Mac Studio 128 GB?

Qwen 3.5 122B-A10B in Q4 (~73 GB) è il punto di partenza più equilibrato: licenza Apache 2.0, buone capacità di chiamata degli strumenti, velocità stimata da 30 a 45 token/s. Se la latenza conta più della finezza delle risposte, Qwen3.8 Flash Next 125B-A6B è più veloce ma va testato più a fondo sulle domande ambigue. Esegui il protocollo di 50 domande su entrambi prima di decidere.

Q: Un modello più piccolo di un 100B sarebbe sufficiente per questo caso d'uso?

Spesso sì per la ricerca nel catalogo e gli stati degli ordini, dove il modello riformula soprattutto i dati forniti. Il vantaggio dei modelli di questo livello emerge nei casi ambigui e nei rifiuti. Il catalogo filtra per VRAM per confrontare con modelli più leggeri; il protocollo di valutazione rimane lo stesso.

Q: Come impedire al modello di inventare un tempo di consegna?

Tre livelli: lo stato proviene sempre da una chiamata a uno strumento, mai dalla memoria del modello; il prompt di sistema impone «nessuna data senza un risultato restituito da uno strumento»; una regola applicativa blocca qualsiasi risposta contenente una data se non è stata effettuata alcuna chiamata. Misura poi il tasso di invenzione sulle tue 20 domande senza risposta: deve restare sotto il 2 %.

Q: Serve un contesto di 1.000.000 token per caricare tutto il catalogo?

Raramente. Caricare un intero catalogo a ogni messaggio moltiplica la latenza di prefill e il consumo di memoria della cache. Una ricerca che restituisce da 5 a 10 schede pertinenti in un contesto da 8.000 a 16.000 token dà risultati migliori e una risposta più rapida. Il contesto molto lungo di DeepSeek V4 Flash serve piuttosto per analisi occasionali.

Q: Qual è la differenza rispetto alla guida sul supporto multilingue?

Questo confronto si limita alle attività transazionali in francese: catalogo, ordini, resi, escalation. Il guida al supporto clienti multilingue tratta il rilevamento della lingua, la traduzione e i set di test per ciascuna lingua. I due si combinano: scegli il modello qui, poi aggiungi il livello multilingue se il tuo negozio effettua consegne al di fuori delle aree francofone.

Q: Come misurare il throughput reale sulla mia macchina?

Carica il modello in Q4 con llama.cpp o vLLM, invia dieci volte la stessa conversazione rappresentativa con 8.000 token di contesto e registra i token/s in generazione e il tempo al primo token. I dati di questo articolo sono stime; i tuoi dipendono dalla banda passante della memoria, dalla quantizzazione e dal numero di sessioni simultanee. La pagina sul benchmark locale descrive un metodo riproducibile.

Conclusione

Un'IA locale per il commercio destinata al servizio clienti si valuta sulla capacità di basarsi sulle fonti e di rifiutare di rispondere, non su un punteggio MMLU. Su un Mac con 128 GB o una workstation con 96 GB, Qwen 3.5 122B-A10B e Mistral Small 4 coprono catalogo, ordini, resi ed escalation con licenza Apache 2.0. Al di sopra di 140 GB, Qwen 3 235B-A22B e MiniMax-M2.7 offrono un margine aggiuntivo sui casi complessi. Verifica la compatibilità con il tuo hardware nel configuratore, poi valida il modello scelto con le tue 50 domande.

L'hardware per eseguire un LLM in locale

Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.

Articolo pubblicato e aggiornato il da Mohamed Meguedmi · Fonte dati: /api/models.json · Licenza dei contenuti: CC BY 4.0.

Un errore o un aggiornamento da segnalare? Contribuire.