Migliore LLM per il servizio clienti nel retail e nell'e-commerce
Implementare un'IA locale per il servizio clienti nell'e-commerce significa eseguire un LLM sulle tue macchine per rispondere ai clienti di un negozio online senza inviare il catalogo, gli ordini o gli indirizzi postali a un servizio terzo. Il modello giusto per questa IA locale dedicata all'e-commerce non è il più grande né quello meglio classificato in un benchmark generalista: è quello che legge correttamente una scheda prodotto, indica lo stato corretto dell'ordine, applica alla lettera la politica di reso e passa la gestione a una persona quando non sa rispondere. Questo articolo illustra le quattro attività da coprire, propone una selezione per fascia hardware nel catalogo quelllm.fr, descrive un protocollo di valutazione dell'aderenza ai dati, poi passa in rassegna licenze e deployment prima di una FAQ.
I quattro compiti di un LLM per il servizio clienti nell'e-commerce
L'ambito è volutamente limitato. Il supporto multilingue è trattato nel guida dedicata al supporto clienti multilingue in locale e il supporto informatico interno non è trattato qui. Restano quattro funzioni che definiscono le specifiche dei requisiti:
- Ricerca nel catalogo prodotti : il modello riceve un estratto del catalogo (schede, disponibilità, varianti, prezzi) tramite un sistema di ricerca e deve rispondere esclusivamente sulla base di questo estratto. Una taglia di abbigliamento inventata o una compatibilità di un accessorio ipotizzata costa un reso.
- Stato dell'ordine : il modello chiama uno strumento (funzione) che interroga il tuo database degli ordini e riformula il risultato. Non deve mai generare un numero di tracciamento o una data di consegna che non provenga da questa chiamata.
- Politica di reso e rimborso : il testo della politica è fornito nel contesto. Il modello deve citare i termini e le condizioni esatti, comprese le esclusioni, e non arrotondare «14 giorni» a «circa due settimane».
- Passaggio a un operatore umano : non appena una richiesta esula dall'ambito previsto (controversia, concessione commerciale, dato mancante), il modello deve produrre una risposta di passaggio a un operatore e un riepilogo strutturato per l'agente umano.
La capacità che differenzia i modelli è quindi l'ancrage : rispondere in base ai dati forniti e rifiutare in modo chiaro quando manca l'informazione. L'architettura consigliata (ricerca documentale, chiamate a strumenti, regole di rifiuto) è descritta nel guida all'architettura di un agente locale.
Selezione per Mac con 128 GB e workstation con due GPU (Q4 tra 68 e 75 GB)
Questo livello corrisponde a un Mac Studio con 128 GB di memoria unificata o a una workstation con una scheda professionale da 96 GB. I modelli qui sotto hanno architetture a esperti (MoE): pochi parametri attivi per token, quindi una velocità di generazione compatibile con una chat in tempo reale nonostante le dimensioni dei pesi. Tutti i valori di velocità di generazione sono stime derivate dal numero di parametri attivi e dalla larghezza di banda della memoria, da confermare sulla tua macchina.
Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parametri : 122B in totale, circa 10B attivi per token - VRAM Q4 : ~73 GB ; Q5 ~88 GB (stimato) ; Q8 ~130 GB (stimato) ; FP16 ~245 GB (stimato) - Contesto : 262.000 token, ampiamente sufficienti per una politica di reso completa, una cronologia della conversazione e una decina di schede prodotto - Velocità di elaborazione : da 30 a 45 token/s stimati su Mac Studio M4 Max 128 GB in Q4; 80 token/s o più stimati su una scheda da 96 GB con vLLM - Perché sceglierlo per l'e-commerce : la famiglia Qwen segue bene le istruzioni sul formato e le chiamate agli strumenti, un aspetto importante per gli stati degli ordini. Pesi pubblicati da Alibaba su Hugging Face.
Mistral Small 4 (Mistral, Apache 2.0) - Parametri : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (stima); FP16 ~240 GB (stima) - Contesto : 256 000 token - Velocità di elaborazione : da confermare in base al numero di parametri attivi dell'architettura; considera un ordine di grandezza simile a quello precedente se il modello è MoE - Perché sceglierlo per l'e-commerce : qualità del francese nella scrittura di testi destinati ai clienti, licenza Apache 2.0 senza clausola commerciale. Pesi pubblicati da Mistral su Hugging Face.
Qwen3.8 Flash Next 125B-A6B (Qwen, licenza open weights, termini da verificare prima dell'uso commerciale) - Parametri : 125B in totale, circa 6B attivi - VRAM Q4 : ~72 GB ; Q8 ~133 GB (stimato) - Contesto : 256 000 token - Velocità di elaborazione : il più veloce della fascia, da 50 a 70 token/s stimati su Mac Studio 128 GB - Perché sceglierlo per l'e-commerce : latenza bassa per una chat con molto traffico. Il rovescio della medaglia: meno parametri attivi, quindi da testare con attenzione sulle domande ambigue.
Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (stimato) - Contesto : 256 000 token - Perché sceglierlo per l'e-commerce : alternativa a Mistral Small 4 quando vuoi un livello di ragionamento in più nei casi di controversia, a scapito di una velocità di generazione inferiore (da confermare).
Per scegliere la macchina, la pagina dedicata ai Mac da 128 GB elenca i modelli che rientrano effettivamente nella memoria disponibile anche con il contesto.
Livello server: 140 GB e oltre
Se disponi di un server con più schede o di una macchina da 192 GB o più, tre modelli offrono un vantaggio qualitativo nei casi complessi (reclami in più fasi, ordini parzialmente spediti).
- Qwen 3 235B-A22B (Alibaba, Apache 2.0): ~142 GB in Q4, ~250 GB in Q8 (stimato), 131.072 token di contesto, circa 22B attivi. Una scelta affidabile per le chiamate a strumenti in sequenza.
- MiniMax-M2.7 (MiniMax, Apache 2.0): ~138 GB in Q4, 205.000 token di contesto. Orientato agli agenti, pertinente quando il servizio clienti esegue prima una ricerca nel catalogo e poi aggiorna un ticket.
- DeepSeek V4 Flash 284B (DeepSeek, MIT): ~170 GB in Q4, contesto di 1.000.000 token. Il contesto molto lungo consente di caricare un intero catalogo di diverse migliaia di referenze senza una ricerca preliminare, ma la latenza di prefill aumenta proporzionalmente. Pesi pubblicati da DeepSeek su Hugging Face. La scelta tra Flash e Pro è dettagliata nel confronto DeepSeek V4 Pro vs Flash.
- GLM 5.3 Flash 320B-A18B (Zhipu, MIT) : ~186 GB in Q4, 128 000 token, 18B attivi. Pesi pubblicati da Zhipu su Hugging Face.
I modelli oltre i 400 GB del catalogo (DeepSeek V4 Pro, Kimi K3, GLM 5.2) sono fuori portata per un deploy in negozio e non offrono un vantaggio misurabile su compiti così ben definiti.
Valutare l'ancoraggio e il rifiuto: il protocollo che conta
I benchmark pubblici (MMLU, HumanEval, AIME) misurano la cultura generale, il codice o la matematica. Nessuno misura «il modello ha inventato un termine per il reso?». Il Open LLM Leaderboard serve a escludere un modello debole, non a sceglierne uno per questo caso d'uso. Crea il tuo set di test: basta mezza giornata:
- 50 domande in tre categorie : 20 la cui risposta è presente nei dati forniti, 20 la cui risposta è assente, 10 ambigue (prodotto disponibile in due varianti, ordine con due pacchi).
- Contesto identico per tutti i modelli : stesse schede prodotto, stessa politica di reso, stesso output simulato dello strumento di gestione degli ordini.
- Tre metriche : accuratezza sulle domande presenti; tasso di rifiuto corretto sulle domande assenti («non ho questa informazione, ti passo a un consulente»); tasso di invenzione, cioè una risposta formulata con sicurezza senza riscontri nel contesto.
- Soglia di accettazione : un tasso di invenzione superiore al 2% sulle domande assenti esclude il modello, qualunque sia la sua qualità in altri ambiti. Un cliente che riceve una data di consegna falsa genera un ticket, un reclamo, a volte una recensione negativa.
- Test del prompt di sistema : aggiungi l'istruzione esplicita «se l'informazione non è nel contesto, rispondi che non lo sai e proponi un trasferimento». Confronta prima e dopo. I modelli elencati sopra reagiscono generalmente bene a questa istruzione, ma la differenza tra loro emerge soprattutto nelle domande ambigue.
Per il livello di ricerca documentale, la guida Firecrawl e RAG locale mostra come creare l'indice del catalogo; il guida GraphRAG tratta il caso dei cataloghi con molte relazioni tra prodotti.
Licenze e dati clienti
Un servizio clienti tratta dati personali: nome, indirizzo, cronologia degli acquisti. Il deployment locale elimina il trasferimento a un fornitore esterno incaricato del trattamento, ma restano due punti da definire.
- Licenza del modello : Apache 2.0 (Qwen 3.5, Mistral Small 4, Qwen 3 235B, MiniMax-M2.7) e MIT (DeepSeek V4 Flash, GLM 5.3 Flash) consentono l'uso commerciale senza condizioni legate al volume. La licenza Modified MIT di Mistral Medium 3.5 e la licenza «altro» di Qwen3.8 Flash Next richiedono una lettura del testo prima della messa in produzione. La NVIDIA Open Model License di Nemotron 3 Super 120B prevede le proprie clausole.
- Registrazione : conserva le conversazioni per la valutazione, ma con un periodo di conservazione definito e la pseudonimizzazione degli identificativi degli ordini. Il guida LLM locale in azienda e RGPD descrive in dettaglio il registro dei trattamenti.
Deployment: motore, interfaccia, latenza obiettivo
- Motore di inferenza : llama.cpp per un Mac Studio o una workstation per un singolo utente in formato GGUF; vLLM quando più clienti chattano in parallelo, perché l'elaborazione in batch moltiplica il throughput complessivo sulla stessa scheda.
- Interfaccia e strumenti : Open WebUI fornisce un'interfaccia di test e la gestione degli strumenti (funzioni) per collegare la tua API degli ordini. In produzione, l'integrazione avviene invece nel tuo widget di chat esistente tramite l'API compatibile con OpenAI esposta dal motore.
- Contesto da riservare : considera da 8.000 a 16.000 token per conversazione (politica di reso, da 5 a 10 schede prodotto, cronologia). Su un Mac da 128 GB con un modello Q4 da 73 GB, rimane margine per più sessioni simultanee.
- Latenza obiettivo : primo token sotto 2 secondi, risposta completa sotto 10 secondi. I modelli MoE del livello 72 GB raggiungono questo obiettivo; i modelli densi di dimensioni simili, no.
Le guida al deployment di un chatbot di team su intranet copre la procedura di avvio passo dopo passo.
FAQ
Q: Quale modello scegliere per iniziare con un Mac Studio 128 GB?
Qwen 3.5 122B-A10B in Q4 (~73 GB) è il punto di partenza più equilibrato: licenza Apache 2.0, buone capacità di chiamata degli strumenti, velocità stimata da 30 a 45 token/s. Se la latenza conta più della finezza delle risposte, Qwen3.8 Flash Next 125B-A6B è più veloce ma va testato più a fondo sulle domande ambigue. Esegui il protocollo di 50 domande su entrambi prima di decidere.
Q: Un modello più piccolo di un 100B sarebbe sufficiente per questo caso d'uso?
Spesso sì per la ricerca nel catalogo e gli stati degli ordini, dove il modello riformula soprattutto i dati forniti. Il vantaggio dei modelli di questo livello emerge nei casi ambigui e nei rifiuti. Il catalogo filtra per VRAM per confrontare con modelli più leggeri; il protocollo di valutazione rimane lo stesso.
Q: Come impedire al modello di inventare un tempo di consegna?
Tre livelli: lo stato proviene sempre da una chiamata a uno strumento, mai dalla memoria del modello; il prompt di sistema impone «nessuna data senza un risultato restituito da uno strumento»; una regola applicativa blocca qualsiasi risposta contenente una data se non è stata effettuata alcuna chiamata. Misura poi il tasso di invenzione sulle tue 20 domande senza risposta: deve restare sotto il 2 %.
Q: Serve un contesto di 1.000.000 token per caricare tutto il catalogo?
Raramente. Caricare un intero catalogo a ogni messaggio moltiplica la latenza di prefill e il consumo di memoria della cache. Una ricerca che restituisce da 5 a 10 schede pertinenti in un contesto da 8.000 a 16.000 token dà risultati migliori e una risposta più rapida. Il contesto molto lungo di DeepSeek V4 Flash serve piuttosto per analisi occasionali.
Q: Qual è la differenza rispetto alla guida sul supporto multilingue?
Questo confronto si limita alle attività transazionali in francese: catalogo, ordini, resi, escalation. Il guida al supporto clienti multilingue tratta il rilevamento della lingua, la traduzione e i set di test per ciascuna lingua. I due si combinano: scegli il modello qui, poi aggiungi il livello multilingue se il tuo negozio effettua consegne al di fuori delle aree francofone.
Q: Come misurare il throughput reale sulla mia macchina?
Carica il modello in Q4 con llama.cpp o vLLM, invia dieci volte la stessa conversazione rappresentativa con 8.000 token di contesto e registra i token/s in generazione e il tempo al primo token. I dati di questo articolo sono stime; i tuoi dipendono dalla banda passante della memoria, dalla quantizzazione e dal numero di sessioni simultanee. La pagina sul benchmark locale descrive un metodo riproducibile.
Conclusione
Un'IA locale per il commercio destinata al servizio clienti si valuta sulla capacità di basarsi sulle fonti e di rifiutare di rispondere, non su un punteggio MMLU. Su un Mac con 128 GB o una workstation con 96 GB, Qwen 3.5 122B-A10B e Mistral Small 4 coprono catalogo, ordini, resi ed escalation con licenza Apache 2.0. Al di sopra di 140 GB, Qwen 3 235B-A22B e MiniMax-M2.7 offrono un margine aggiuntivo sui casi complessi. Verifica la compatibilità con il tuo hardware nel configuratore, poi valida il modello scelto con le tue 50 domande.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.