Guida di riferimento · 16 capitoli · script inclusi · aggiornamenti a vita

Un RAG locale che
funziona davvero bene

Il kit RAG Local : Il manuale di riferimento per costruire un RAG affidabile sui tuoi documenti — PDF, appunti, email, bibliografia Zotero — senza inviare nulla in cloud. Il RAG che regge su 300 PDF, non la demo che funziona una volta su tre.

Ottieni il kit — 24 €

24 € · pagamento unico · aggiornamenti a vita inclusi

✓ Accesso immediato (online + PDF) ✓ Pagamento sicuro Stripe ✓ Rimborsabile per 30 giorni ✓ Edizione in continua evoluzione (aggiornamenti a vita)

Vedi i 16 capitoli →

Che cos'è il kit RAG Local?

Il kit RAG Locale è una guida di riferimento di 16 capitoli (103 pagine), con 20 script e modelli e uno spazio online accessibile a vita. È rivolto a professionisti, ricercatori e sviluppatori che hanno dimestichezza con la riga di comando, su un PC (8-16 GB di VRAM) o un Mac mini M4 da 24 GB. Risultato: una pipeline RAG completa — ingestione, chunking, embedding in francese, indice, ricerca ibrida, reranking — misurata con un protocollo di recall@k, non soltanto testata su tre esempi.

  • 16 capitoli (103 pagine) e 20 script, modelli e confronti da scaricare.
  • 2 profili coperti: PC 8-16 GB di VRAM, o Mac mini M4 24 GB.
  • Database vettoriali trattati: ChromaDB, Qdrant e LanceDB, a scelta.
  • Embeddings francesi confrontati: bge-m3 e nomic-embed-text-v2-moe.
  • Protocollo di misurazione del recall@k su un insieme di domande, da 30 a 50.
  • 24 € con un pagamento unico, aggiornamenti a vita inclusi, soddisfatti o rimborsati entro 30 giorni.
Copertina del kit RAG Locale — RAG Locale

✓ Per te se…

sei un professionista, ricercatore o sviluppatore, a tuo agio con la riga di comando (Python è utile per la maggior parte dei capitoli, ma non è obbligatorio), usi già l'IA in locale (Ollama/LM Studio, eventualmente il kit IA Locale) e vuoi un RAG che vada oltre il semplice clic su un pulsante su decine o centinaia di documenti — contratti, bibliografia Zotero, corrispondenza, wiki interno.

✗ Non per te se…

vuoi solo porre una domanda a tre PDF di tanto in tanto (è già previsto nel kit IA Locale, cap. 8); cerchi un RAG documentale per alimentare un copilota di codice (è il kit Copilota Locale); oppure effettui un deployment per più utenti in azienda con vincoli RGPD (il kit IA Locale in Azienda).

24 € Pagamento unico · aggiornamenti inclusi a vita Garanzia di 30 giorni — se non sei convinto, basta un'email per ottenere il rimborso 7 guide RAG sparse sul sito + ore di assemblaggio. Questo kit: 24 €, la pipeline già assemblata e testata.

Perché puoi farci affidamento

Questa guida è scritta e aggiornata da il team di QuelLLM.fr — 250 modelli indicizzati, 335 guide in francese, aggiornati ogni mattina — che gestisce anche piattaforme IA in produzione tutto l'anno (RegulIA, IAPRO). Ogni comando, modello e licenza di questa guida viene verificato rispetto alla fonte ufficiale alla data dell'edizione (e verificato nuovamente a ogni edizione), sulle configurazioni delle macchine che usiamo noi stessi (PC con 8-16 GB di VRAM, Mac mini M4 con 24 GB); tutti gli script del pacchetto si compilano correttamente e vengono riletti uno per uno. Quello che leggi è condensato, verificato, senza giri di parole. Non è una raccolta di tutorial trovati a caso. Chi c'è dietro QuelLLM →

Il problema

Hai già un assistente IA locale, forse anche un RAG utilizzabile con pochi clic (AnythingLLM, Open WebUI). Trascini un PDF, fai una domanda, ricevi una risposta — e poi un giorno la risposta è fuori tema, o peggio, contiene una citazione inventata che non esiste nel documento. Con 300 PDF, un'intera biblioteca Zotero o anni di corrispondenza, l'approccio a pochi clic non basta più: chunking ingenuo, nessuna citazione verificabile, e soprattutto niente è mai misurato — lo ritieni affidabile sulla base di tre esempi, non di un protocollo.

L'informazione di base è già gratuita sul sito, suddivisa in 7 guide (ChromaDB, chunking, ibrido BM25, Zotero, embedding in francese, reranking, LlamaIndex). Il kit è IL metodo di riferimento: la pipeline completa assemblata e testata — ingestione, chunking misurato, embedding FR, indice scalabile, ricerca ibrida, reranking e un metodo per verificare che funzioni davvero — non una raccolta di tutorial da confrontare e integrare da solo.

RAG assemblato e misurato vs il RAG con un clic vs incollare tutto al LLM

La stessa esigenza — interrogare i tuoi documenti — tre modi per soddisfarla. Il confronto onesto:

RAG assemblato (questo kit)RAG con un clicIncollare tutto nel LLM
Rimane su centinaia di documentiSìLimitatoNo
Citazione sistematica e verificabileSì, richiestaRaramente affidabileNo
Ricerca ibrida (identificatori, nomi propri)Sì (BM25 + vettoriale)NoNon applicabile
Qualità misurata (recall@k prima/dopo)Sì, protocollo fornitoNoNo
ImplementazionePiù sessioni, pipeline pulitaAlcuni minutiImmediato
Confidenzialità (100 % locale)SìSìA seconda del LLM utilizzato
Costo0 €/mese una volta installato0 €/meseContesto costoso oltre pochi documenti

L'uso con un semplice clic resta una buona scelta per un utilizzo occasionale su tre documenti (è il kit IA Locale, Cap. 8). Questo kit subentra quando il corpus, la posta in gioco o l'affidabilità richiesta superano ciò che un semplice clic può gestire.

Cosa ottieni

Strumenti: ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embedding: bge-m3, nomic-embed-text-v2-moe. 100 % locale, 0 €/mese una volta allestito.

I 16 capitoli del kit

103 pagine, dalle basi della pipeline al RAG misurato e reso affidabile. Non c'è nulla da saltare: ogni capitolo rimanda ai successivi.

Parte 1 — Fondamenti di un RAG che funziona
  • Il tuo attuale RAG mente (o perché esiste questo kit)
  • Anatomia di una pipeline RAG solida
  • Scegliere la stack: script, framework o interfaccia avanzata
Parte 2 — Ingestione: oltre il bel PDF
  • OCR, pulizia, deduplicazione: acquisire i dati realmente disponibili
  • Zotero: collegare la propria bibliografia a un RAG che cita veramente
  • Email e corrispondenza: un corpus che si dimentica di usare per il RAG
  • Chunking: le 5 strategie e come misurare quale dà i risultati migliori
Parte 3 — Il motore: embeddings, indice, recupero
  • Embedding multilingui FR: quale scegliere e come verificare
  • Indice vettoriale locale: ChromaDB, Qdrant, LanceDB — quale nel 2026
  • Ricerca ibrida: quando la sola ricerca vettoriale non basta
  • Reranking: il cross-encoder che corregge il retrieval
Parte 4 — Orchestrare, misurare, rendere affidabile
  • LlamaIndex e LangChain in locale: costruire andando oltre uno script scritto a mano
  • Open WebUI Knowledge e AnythingLLM per un uso avanzato
  • Valutare il proprio RAG: insieme di domande, citazioni, allucinazioni
  • Costo, velocità, risoluzione dei problemi per macchina
  • RAG in azione — e ciò che segue

Edizione in continuo aggiornamento: ogni aggiornamento arricchisce questo sommario (registro degli aggiornamenti datato, cap. 16) — non dovrai riacquistare nulla alla prossima versione.

Trois risultati rapidi prima ancora di aprire un terminale

Il Capitolo 1 non si limita a delineare il contesto: ti dà tre miglioramenti misurabili sull'installazione attuale, ciascuno in meno di 30 minuti.

1 · Valuta il tuo attuale RAG

La checklist in 10 punti individua in 10 minuti il punto più debole della tua installazione esistente (o l'assenza di un'installazione).

2 · Cambia embedder con un solo comando

ollama pull bge-m3, cambi l'embedder in AnythingLLM o Open WebUI, confronti prima e dopo.

3 · Esigi una citazione verificabile

Una clausola di citazione rigorosa aggiunta a una domanda già posta — e tu verifichi che il passaggio citato esista veramente.

4 · Poi costruisci la pipeline completa

Ingestione, chunking misurato, embedding FR, indice, ibrido, reranking: le parti dalla 2 alla 4 ti guidano passo dopo passo.

24 €
Pagamento unico · aggiornamenti a vita inclusi
7 guide RAG sparse sul sito, ore di assemblaggio e test. Questo kit: 24 € una sola volta, pipeline già assemblata.
Soddisfatti o rimborsati entro 30 giorni — basta un'email.
  • Spazio online a vita: 16 capitoli sempre aggiornati (sommario completo più su)
  • Il manuale PDF (103 pagine) + i 20 file (script, template, confronti — Zotero, chunking, ibrido, reranking, valutazione…) da scaricare
  • I 2 profili di riferimento (PC 8-16 GB, Mac 24 GB) e l'albero di risoluzione dei problemi RAG
  • Tutte le edizioni future, a vita — appaiono nel tuo spazio
  • Accesso immediato dopo il pagamento, chiave d'accesso inviata via email
Prendo il kit — 24 €

Pagamento sicuro con Stripe. Fattura PDF inviata automaticamente · IVA non applicabile, art. 293 B del CGI.

Prendo il kit — 24 €

La verità detta con franchezza

Un RAG locale realizzato e sottoposto a misurazioni gestisce molto bene i tuoi documenti, ma non è la soluzione a tutto. Un manuale di riferimento deve offrirti questa panoramica onesta:

Questo kit guadagnariservatezza totale · citazione verificabile · funziona con centinaia di documenti · qualità misurata, non presunta · 0 €/mese una volta configurato
Le soluzioni utilizzabili con un clic o il cloud mantengono il vantaggiouso occasionale su 2-3 documenti · installazione immediata senza script · deploy multiutente in azienda · orchestrazione di agenti a più fasi

Alla fine, tu sai fare

Edizione vivante — come tutti i kit QuelLLM

«Aggiornamenti a vita» non è uno slogan: il kit segue per te l'ecosistema RAG (modelli di embedding, database vettoriali, framework), senza farti pagare di nuovo.

CHANGELOG.md — incluso nel pack

v2026.09 (edizione attuale) — prima edizione del kit: 16 capitoli, 2 profili di riferimento (PC con 8-16 GB di VRAM, Mac mini M4 con 24 GB), 20 file (script, template, confronti).

Le prossime edizioni (nuovi modelli di embedding, database vettoriali, framework) vengono aggiunte qui, con la relativa data, e arrivano nel tuo spazio senza che tu debba pagare di nuovo.

Domande frequenti

Qual è la differenza rispetto al kit IA Locale, che ha già un capitolo RAG?

Il kit IA Locale (Cap.8) ti installa un RAG utilizzabile con pochi clic in AnythingLLM o Open WebUI — trascini un PDF, fai una domanda e funziona per un uso occasionale. Questo kit inizia dove quel capitolo si ferma: chunking misurato, embedding per il francese messi a confronto, indice vettoriale scalabile, ricerca ibrida, reranking e soprattutto un metodo per verificare che il tuo RAG risponda correttamente — non solo che risponda. Nessun contenuto del Cap.8 viene spiegato di nuovo qui: vengono trattate solo le impostazioni avanzate e i componenti assenti nelle soluzioni utilizzabili con pochi clic.

Qual è la differenza rispetto alle 7 guide RAG gratuite del sito?

Le guide gratuite di QuelLLM.fr coprono ogni componente separatamente (solo ChromaDB, solo chunking, solo ricerca ibrida BM25, solo Zotero…). Il kit assembla l'intera pipeline nell'ordine (ingestione → chunking → embedding → indice → ricerca ibrida → reranking → generazione → citazione → misurazione), collega ciò che ogni singola guida non collega e fornisce i 20 file testati (script, modelli, confronti) che nessuna singola guida offre — ciò che si paga sono l'assemblaggio e gli script, non le informazioni di base.

È necessario sapere programmare in Python per seguire questo kit?

Python 3.10+ è utile e ti serve per la maggior parte dei capitoli (dal Cap. 4 al Cap. 12): gli script sono forniti, da adattare, non da scrivere da zero. Il Capitolo 13 (Open WebUI Knowledge, AnythingLLM con impostazioni avanzate) rimane accessibile senza scrivere una riga di codice. Questo kit presuppone familiarità con la riga di comando; se parti da zero con l'IA locale, comincia dal kit IA Locale.

Quanto tempo per un primo risultato concreto?

Il capitolo 1 propone 3 interventi rapidi da meno di 30 minuti ciascuno, applicabili a un RAG già in funzione (audit rapido, cambio di embedder con un solo comando, richiesta obbligatoria di una citazione verificabile) — ottieni un miglioramento misurabile prima ancora di affrontare la pipeline completa. Costruire una pipeline completa sul tuo corpus (Parti da 2 a 4) richiede diverse sessioni, non un'ora.

Su quale macchina funziona?

Due configurazioni di riferimento, indicate in ogni esempio: un PC con da 8 a 16 GB di VRAM (il modello di generazione consigliato cambia a seconda dell'estremo dell'intervallo considerato) oppure un Mac Apple Silicon con 24 GB di memoria unificata. In un RAG, il collo di bottiglia non è quasi mai la generazione, ma l'ingestione (OCR, embedding) e la dimensione dell'indice: le due configurazioni coprono la maggior parte delle configurazioni reali per uso professionale e sviluppo.

I miei documenti restano riservati?

È proprio questo il principio: la pipeline (ingestione, embedding, indice, generazione) gira interamente sulla tua macchina e nulla viene inviato a terzi. Il Capitolo 15 affronta nello specifico cosa cambia per un corpus di email o documenti sensibili. Per un deployment multiutente in azienda (GDPR, AI Act, architettura server), il kit da usare è IA Locale per Azienda (quelllm.fr/kit-ia-entreprise), non questo.

Il kit include gli agenti o l'automazione?

Il Capitolo 12 mostra l'uso del RAG come strumento da parte di un agente minimale (un agente, due strumenti) — quanto basta per capire il principio, con un rinvio esplicito al kit Agenti Locali (quelllm.fr/kit-agents-locaux) per l'orchestrazione in più passaggi, MCP o n8n. Non è questo l'argomento di questo kit.

E se non mi soddisfa dopo l'acquisto?

Soddisfatti o rimborsati entro 30 giorni, basta un'email, senza giustificazioni — come per tutti i kit QuelLLM.

In che forma viene fornito e per quanto tempo?

Accesso immediato dopo il pagamento: il tuo spazio online a vita (sempre con l’ultima edizione) + il PDF e lo ZIP dei 20 file da scaricare, tuoi per sempre. Gli aggiornamenti futuri (nuovi embedder, nuove basi di dati vettoriali, framework che evolvono) compaiono nel tuo spazio senza dover pagare di nuovo.

Posso avere una fattura?

Sì, automaticamente. Appena effettuato il pagamento (Stripe), ricevi via email la tua ricevuta Stripe e la tua fattura PDF emessa da Falcon Consulting (editore di QuelLLM), con i tuoi dati — indica la tua azienda o il tuo SIREN nel campo previsto al momento del pagamento. IVA non applicabile, art. 293 B del CGI.

Il kit rimane aggiornato? I database vettoriali e i framework RAG evolvono rapidamente.

È il principio degli aggiornamenti a vita: quando un embedder cambia stato, un database vettoriale matura o un framework interrompe una compatibilità, l'edizione viene aggiornata di conseguenza — come per gli altri kit QuelLLM. Il Capitolo 16 spiega anche come verificare tu stesso se un fatto citato è ancora attuale tra un'edizione e l'altra.

E se voglio più kit QuelLLM?

Il bundle « tutti i kit, a vita » include tutti i kit attuali e futuri per 49 €. Se hai già acquistato un kit a 24 €, l'upgrade al bundle ti costa 25 €, non 49 € — il coupon viene applicato automaticamente.

Che cos'è esattamente il RAG?

RAG (retrieval-augmented generation, cioè generazione aumentata tramite recupero delle informazioni) significa che un LLM cerca le informazioni nei tuoi documenti prima di rispondere, invece di rispondere soltanto con ciò che ha imparato durante l'addestramento — fornendo, in linea di principio, una citazione verificabile della fonte. Il kit RAG Local costruisce questa pipeline completa, con prestazioni misurate, sui tuoi PDF, sulla tua bibliografia o sulle tue email.

Come collegare Ollama a un RAG?

Ollama funge da motore di generazione (e spesso di embedding) in una pipeline RAG: uno strumento utilizzabile con pochi clic come AnythingLLM o Open WebUI Knowledge vi si collega direttamente per un uso occasionale. Per una pipeline che regga centinaia di documenti, il kit RAG Local mostra come collegare Ollama a ChromaDB o Qdrant, con uno script testato anziché con la sola interfaccia.

Quale LLM scegliere per un RAG locale?

La scelta conta meno della pipeline che lo circonda: un modello generalista che la tua macchina può eseguire è sufficiente per la generazione, a condizione che il retrieval a monte (chunking, embedding, ricerca ibrida, reranking) gli fornisca i passaggi giusti da leggere. Il kit RAG Local descrive in dettaglio questa catena completa, non solo la scelta del modello finale.

Costruisci un RAG affidabile.

Il manuale di riferimento, dal primo PDF caricato al RAG misurato e affidabile sulla tua intera biblioteca — senza inviare nulla in cloud. Oggi, non «un giorno».

Ottieni il kit — 24 €