Guida di riferimento · 16 capitoli · script inclusi · aggiornamenti a vita
Un RAG locale che
funziona davvero bene
Il kit RAG Local : Il manuale di riferimento per costruire un RAG affidabile sui tuoi documenti — PDF, appunti, email, bibliografia Zotero — senza inviare nulla in cloud. Il RAG che regge su 300 PDF, non la demo che funziona una volta su tre.
Ottieni il kit — 24 €24 € · pagamento unico · aggiornamenti a vita inclusi
Che cos'è il kit RAG Local?
Il kit RAG Locale è una guida di riferimento di 16 capitoli (103 pagine), con 20 script e modelli e uno spazio online accessibile a vita. È rivolto a professionisti, ricercatori e sviluppatori che hanno dimestichezza con la riga di comando, su un PC (8-16 GB di VRAM) o un Mac mini M4 da 24 GB. Risultato: una pipeline RAG completa — ingestione, chunking, embedding in francese, indice, ricerca ibrida, reranking — misurata con un protocollo di recall@k, non soltanto testata su tre esempi.
- 16 capitoli (103 pagine) e 20 script, modelli e confronti da scaricare.
- 2 profili coperti: PC 8-16 GB di VRAM, o Mac mini M4 24 GB.
- Database vettoriali trattati: ChromaDB, Qdrant e LanceDB, a scelta.
- Embeddings francesi confrontati: bge-m3 e nomic-embed-text-v2-moe.
- Protocollo di misurazione del recall@k su un insieme di domande, da 30 a 50.
- 24 € con un pagamento unico, aggiornamenti a vita inclusi, soddisfatti o rimborsati entro 30 giorni.
✓ Per te se…
sei un professionista, ricercatore o sviluppatore, a tuo agio con la riga di comando (Python è utile per la maggior parte dei capitoli, ma non è obbligatorio), usi già l'IA in locale (Ollama/LM Studio, eventualmente il kit IA Locale) e vuoi un RAG che vada oltre il semplice clic su un pulsante su decine o centinaia di documenti — contratti, bibliografia Zotero, corrispondenza, wiki interno.
✗ Non per te se…
vuoi solo porre una domanda a tre PDF di tanto in tanto (è già previsto nel kit IA Locale, cap. 8); cerchi un RAG documentale per alimentare un copilota di codice (è il kit Copilota Locale); oppure effettui un deployment per più utenti in azienda con vincoli RGPD (il kit IA Locale in Azienda).
Perché puoi farci affidamento
Questa guida è scritta e aggiornata da il team di QuelLLM.fr — 250 modelli indicizzati, 335 guide in francese, aggiornati ogni mattina — che gestisce anche piattaforme IA in produzione tutto l'anno (RegulIA, IAPRO). Ogni comando, modello e licenza di questa guida viene verificato rispetto alla fonte ufficiale alla data dell'edizione (e verificato nuovamente a ogni edizione), sulle configurazioni delle macchine che usiamo noi stessi (PC con 8-16 GB di VRAM, Mac mini M4 con 24 GB); tutti gli script del pacchetto si compilano correttamente e vengono riletti uno per uno. Quello che leggi è condensato, verificato, senza giri di parole. Non è una raccolta di tutorial trovati a caso. Chi c'è dietro QuelLLM →
Il problema
Hai già un assistente IA locale, forse anche un RAG utilizzabile con pochi clic (AnythingLLM, Open WebUI). Trascini un PDF, fai una domanda, ricevi una risposta — e poi un giorno la risposta è fuori tema, o peggio, contiene una citazione inventata che non esiste nel documento. Con 300 PDF, un'intera biblioteca Zotero o anni di corrispondenza, l'approccio a pochi clic non basta più: chunking ingenuo, nessuna citazione verificabile, e soprattutto niente è mai misurato — lo ritieni affidabile sulla base di tre esempi, non di un protocollo.
L'informazione di base è già gratuita sul sito, suddivisa in 7 guide (ChromaDB, chunking, ibrido BM25, Zotero, embedding in francese, reranking, LlamaIndex). Il kit è IL metodo di riferimento: la pipeline completa assemblata e testata — ingestione, chunking misurato, embedding FR, indice scalabile, ricerca ibrida, reranking e un metodo per verificare che funzioni davvero — non una raccolta di tutorial da confrontare e integrare da solo.
RAG assemblato e misurato vs il RAG con un clic vs incollare tutto al LLM
La stessa esigenza — interrogare i tuoi documenti — tre modi per soddisfarla. Il confronto onesto:
| RAG assemblato (questo kit) | RAG con un clic | Incollare tutto nel LLM | |
|---|---|---|---|
| Rimane su centinaia di documenti | Sì | Limitato | No |
| Citazione sistematica e verificabile | Sì, richiesta | Raramente affidabile | No |
| Ricerca ibrida (identificatori, nomi propri) | Sì (BM25 + vettoriale) | No | Non applicabile |
| Qualità misurata (recall@k prima/dopo) | Sì, protocollo fornito | No | No |
| Implementazione | Più sessioni, pipeline pulita | Alcuni minuti | Immediato |
| Confidenzialità (100 % locale) | Sì | Sì | A seconda del LLM utilizzato |
| Costo | 0 €/mese una volta installato | 0 €/mese | Contesto costoso oltre pochi documenti |
L'uso con un semplice clic resta una buona scelta per un utilizzo occasionale su tre documenti (è il kit IA Locale, Cap. 8). Questo kit subentra quando il corpus, la posta in gioco o l'affidabilità richiesta superano ciò che un semplice clic può gestire.
Cosa ottieni
- Il tuo spazio online, per sempre — i 16 capitoli leggibili online, sempre l'ultima edizione.
- Il manuale completo in PDF (103 pagine) — lo stesso contenuto, tuo per sempre, offline.
- 20 file pronti all'uso (script, modelli, confronti) — passaggio OCR→visione, pipeline Zotero con citazione, parsing mbox, 3 strategie di chunking, confronti tra embedding e tra database vettoriali, ricerca ibrida RRF, aggiunta di un reranker, pipeline LlamaIndex e agente LangChain, script per misurare recall@k, albero decisionale per la risoluzione dei problemi.
- 2 profili di riferimento — PC 8-16 GB di VRAM, Mac mini M4 24 GB: tu ritrovi la tua configurazione in ogni esempio, mai un caso che non ti riguardi.
- Protocollo di misurazione (Cap. 14) — costruire un insieme di 30-50 domande, misurare un recall@k prima/dopo un cambiamento, rilevare un'allucinazione senza una citazione valida secondo un vero protocollo, non sulla base di un'impressione.
- Edizione in continuo aggiornamento — ogni aggiornamento (nuovi modelli di embedding, database vettoriali, framework) appare nel tuo spazio, per sempre, senza dover pagare di nuovo.
Strumenti: ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embedding: bge-m3, nomic-embed-text-v2-moe. 100 % locale, 0 €/mese una volta allestito.
I 16 capitoli del kit
103 pagine, dalle basi della pipeline al RAG misurato e reso affidabile. Non c'è nulla da saltare: ogni capitolo rimanda ai successivi.
- Il tuo attuale RAG mente (o perché esiste questo kit)
- Anatomia di una pipeline RAG solida
- Scegliere la stack: script, framework o interfaccia avanzata
- OCR, pulizia, deduplicazione: acquisire i dati realmente disponibili
- Zotero: collegare la propria bibliografia a un RAG che cita veramente
- Email e corrispondenza: un corpus che si dimentica di usare per il RAG
- Chunking: le 5 strategie e come misurare quale dà i risultati migliori
- Embedding multilingui FR: quale scegliere e come verificare
- Indice vettoriale locale: ChromaDB, Qdrant, LanceDB — quale nel 2026
- Ricerca ibrida: quando la sola ricerca vettoriale non basta
- Reranking: il cross-encoder che corregge il retrieval
- LlamaIndex e LangChain in locale: costruire andando oltre uno script scritto a mano
- Open WebUI Knowledge e AnythingLLM per un uso avanzato
- Valutare il proprio RAG: insieme di domande, citazioni, allucinazioni
- Costo, velocità, risoluzione dei problemi per macchina
- RAG in azione — e ciò che segue
Edizione in continuo aggiornamento: ogni aggiornamento arricchisce questo sommario (registro degli aggiornamenti datato, cap. 16) — non dovrai riacquistare nulla alla prossima versione.
Trois risultati rapidi prima ancora di aprire un terminale
Il Capitolo 1 non si limita a delineare il contesto: ti dà tre miglioramenti misurabili sull'installazione attuale, ciascuno in meno di 30 minuti.
1 · Valuta il tuo attuale RAG
La checklist in 10 punti individua in 10 minuti il punto più debole della tua installazione esistente (o l'assenza di un'installazione).
2 · Cambia embedder con un solo comando
ollama pull bge-m3, cambi l'embedder in AnythingLLM o Open WebUI, confronti prima e dopo.
3 · Esigi una citazione verificabile
Una clausola di citazione rigorosa aggiunta a una domanda già posta — e tu verifichi che il passaggio citato esista veramente.
4 · Poi costruisci la pipeline completa
Ingestione, chunking misurato, embedding FR, indice, ibrido, reranking: le parti dalla 2 alla 4 ti guidano passo dopo passo.
- Spazio online a vita: 16 capitoli sempre aggiornati (sommario completo più su)
- Il manuale PDF (103 pagine) + i 20 file (script, template, confronti — Zotero, chunking, ibrido, reranking, valutazione…) da scaricare
- I 2 profili di riferimento (PC 8-16 GB, Mac 24 GB) e l'albero di risoluzione dei problemi RAG
- Tutte le edizioni future, a vita — appaiono nel tuo spazio
- Accesso immediato dopo il pagamento, chiave d'accesso inviata via email
Pagamento sicuro con Stripe. Fattura PDF inviata automaticamente · IVA non applicabile, art. 293 B del CGI.
La verità detta con franchezza
Un RAG locale realizzato e sottoposto a misurazioni gestisce molto bene i tuoi documenti, ma non è la soluzione a tutto. Un manuale di riferimento deve offrirti questa panoramica onesta:
Alla fine, tu sai fare
- Costruire una pipeline RAG completa — ingestione, chunking, embedding FR, indice, ibrido, reranking, generazione con citazione.
- Collegare Zotero, la tua corrispondenza email o PDF scansionati su un RAG che cita veramente le sue fonti.
- Scegliere chunking, embedder e database vettoriale con cognizione di causa, non per impostazione predefinita.
- Misurare un recall@k prima/dopo un cambiamento, invece di credere che «funziona meglio».
- Passare da uno script scritto a mano a un framework (LlamaIndex/LangChain) o sfruttare le impostazioni avanzate di AnythingLLM/Open WebUI in base alle tue esigenze.
Edizione vivante — come tutti i kit QuelLLM
«Aggiornamenti a vita» non è uno slogan: il kit segue per te l'ecosistema RAG (modelli di embedding, database vettoriali, framework), senza farti pagare di nuovo.
v2026.09 (edizione attuale) — prima edizione del kit: 16 capitoli, 2 profili di riferimento (PC con 8-16 GB di VRAM, Mac mini M4 con 24 GB), 20 file (script, template, confronti).
Le prossime edizioni (nuovi modelli di embedding, database vettoriali, framework) vengono aggiunte qui, con la relativa data, e arrivano nel tuo spazio senza che tu debba pagare di nuovo.
Domande frequenti
Qual è la differenza rispetto al kit IA Locale, che ha già un capitolo RAG?
Il kit IA Locale (Cap.8) ti installa un RAG utilizzabile con pochi clic in AnythingLLM o Open WebUI — trascini un PDF, fai una domanda e funziona per un uso occasionale. Questo kit inizia dove quel capitolo si ferma: chunking misurato, embedding per il francese messi a confronto, indice vettoriale scalabile, ricerca ibrida, reranking e soprattutto un metodo per verificare che il tuo RAG risponda correttamente — non solo che risponda. Nessun contenuto del Cap.8 viene spiegato di nuovo qui: vengono trattate solo le impostazioni avanzate e i componenti assenti nelle soluzioni utilizzabili con pochi clic.
Qual è la differenza rispetto alle 7 guide RAG gratuite del sito?
Le guide gratuite di QuelLLM.fr coprono ogni componente separatamente (solo ChromaDB, solo chunking, solo ricerca ibrida BM25, solo Zotero…). Il kit assembla l'intera pipeline nell'ordine (ingestione → chunking → embedding → indice → ricerca ibrida → reranking → generazione → citazione → misurazione), collega ciò che ogni singola guida non collega e fornisce i 20 file testati (script, modelli, confronti) che nessuna singola guida offre — ciò che si paga sono l'assemblaggio e gli script, non le informazioni di base.
È necessario sapere programmare in Python per seguire questo kit?
Python 3.10+ è utile e ti serve per la maggior parte dei capitoli (dal Cap. 4 al Cap. 12): gli script sono forniti, da adattare, non da scrivere da zero. Il Capitolo 13 (Open WebUI Knowledge, AnythingLLM con impostazioni avanzate) rimane accessibile senza scrivere una riga di codice. Questo kit presuppone familiarità con la riga di comando; se parti da zero con l'IA locale, comincia dal kit IA Locale.
Quanto tempo per un primo risultato concreto?
Il capitolo 1 propone 3 interventi rapidi da meno di 30 minuti ciascuno, applicabili a un RAG già in funzione (audit rapido, cambio di embedder con un solo comando, richiesta obbligatoria di una citazione verificabile) — ottieni un miglioramento misurabile prima ancora di affrontare la pipeline completa. Costruire una pipeline completa sul tuo corpus (Parti da 2 a 4) richiede diverse sessioni, non un'ora.
Su quale macchina funziona?
Due configurazioni di riferimento, indicate in ogni esempio: un PC con da 8 a 16 GB di VRAM (il modello di generazione consigliato cambia a seconda dell'estremo dell'intervallo considerato) oppure un Mac Apple Silicon con 24 GB di memoria unificata. In un RAG, il collo di bottiglia non è quasi mai la generazione, ma l'ingestione (OCR, embedding) e la dimensione dell'indice: le due configurazioni coprono la maggior parte delle configurazioni reali per uso professionale e sviluppo.
I miei documenti restano riservati?
È proprio questo il principio: la pipeline (ingestione, embedding, indice, generazione) gira interamente sulla tua macchina e nulla viene inviato a terzi. Il Capitolo 15 affronta nello specifico cosa cambia per un corpus di email o documenti sensibili. Per un deployment multiutente in azienda (GDPR, AI Act, architettura server), il kit da usare è IA Locale per Azienda (quelllm.fr/kit-ia-entreprise), non questo.
Il kit include gli agenti o l'automazione?
Il Capitolo 12 mostra l'uso del RAG come strumento da parte di un agente minimale (un agente, due strumenti) — quanto basta per capire il principio, con un rinvio esplicito al kit Agenti Locali (quelllm.fr/kit-agents-locaux) per l'orchestrazione in più passaggi, MCP o n8n. Non è questo l'argomento di questo kit.
E se non mi soddisfa dopo l'acquisto?
Soddisfatti o rimborsati entro 30 giorni, basta un'email, senza giustificazioni — come per tutti i kit QuelLLM.
In che forma viene fornito e per quanto tempo?
Accesso immediato dopo il pagamento: il tuo spazio online a vita (sempre con l’ultima edizione) + il PDF e lo ZIP dei 20 file da scaricare, tuoi per sempre. Gli aggiornamenti futuri (nuovi embedder, nuove basi di dati vettoriali, framework che evolvono) compaiono nel tuo spazio senza dover pagare di nuovo.
Posso avere una fattura?
Sì, automaticamente. Appena effettuato il pagamento (Stripe), ricevi via email la tua ricevuta Stripe e la tua fattura PDF emessa da Falcon Consulting (editore di QuelLLM), con i tuoi dati — indica la tua azienda o il tuo SIREN nel campo previsto al momento del pagamento. IVA non applicabile, art. 293 B del CGI.
Il kit rimane aggiornato? I database vettoriali e i framework RAG evolvono rapidamente.
È il principio degli aggiornamenti a vita: quando un embedder cambia stato, un database vettoriale matura o un framework interrompe una compatibilità, l'edizione viene aggiornata di conseguenza — come per gli altri kit QuelLLM. Il Capitolo 16 spiega anche come verificare tu stesso se un fatto citato è ancora attuale tra un'edizione e l'altra.
E se voglio più kit QuelLLM?
Il bundle « tutti i kit, a vita » include tutti i kit attuali e futuri per 49 €. Se hai già acquistato un kit a 24 €, l'upgrade al bundle ti costa 25 €, non 49 € — il coupon viene applicato automaticamente.
Che cos'è esattamente il RAG?
RAG (retrieval-augmented generation, cioè generazione aumentata tramite recupero delle informazioni) significa che un LLM cerca le informazioni nei tuoi documenti prima di rispondere, invece di rispondere soltanto con ciò che ha imparato durante l'addestramento — fornendo, in linea di principio, una citazione verificabile della fonte. Il kit RAG Local costruisce questa pipeline completa, con prestazioni misurate, sui tuoi PDF, sulla tua bibliografia o sulle tue email.
Come collegare Ollama a un RAG?
Ollama funge da motore di generazione (e spesso di embedding) in una pipeline RAG: uno strumento utilizzabile con pochi clic come AnythingLLM o Open WebUI Knowledge vi si collega direttamente per un uso occasionale. Per una pipeline che regga centinaia di documenti, il kit RAG Local mostra come collegare Ollama a ChromaDB o Qdrant, con uno script testato anziché con la sola interfaccia.
Quale LLM scegliere per un RAG locale?
La scelta conta meno della pipeline che lo circonda: un modello generalista che la tua macchina può eseguire è sufficiente per la generazione, a condizione che il retrieval a monte (chunking, embedding, ricerca ibrida, reranking) gli fornisca i passaggi giusti da leggere. Il kit RAG Local descrive in dettaglio questa catena completa, non solo la scelta del modello finale.
Costruisci un RAG affidabile.
Il manuale di riferimento, dal primo PDF caricato al RAG misurato e affidabile sulla tua intera biblioteca — senza inviare nulla in cloud. Oggi, non «un giorno».
Ottieni il kit — 24 €