Salta al contenuto

AI Solutions · Approfondimento

Knowledge base RAG: risposte ancorate alle fonti, non inventate

Costruiamo basi di conoscenza che rispondono solo da fonti verificate: retrieval ibrido, grounding sui documenti, citazioni tracciabili, controllo delle allucinazioni e valutazione continua della qualità. Quando la fonte non basta, il sistema lo dichiara invece di inventare.

AI e Vokira — parole dentro, lavoro fuori

KNOWLEDGE BASE · RETRIEVAL ANCORATO

Entra · Domanda dell'utente

Esce · Risposta citata e verificabile

01

Ingestione delle fonti di verità e chunking

Normalizza i documenti sorgente e li spezza in frammenti coerenti dimensionati per tipo di contenuto, attaccando a ognuno i metadati di origine — titolo, sezione, data, permessi — che diventano la base di citazioni e controllo accessi: senza un'ingestione pulita, tutto ciò che segue cita aria.

02

Retrieval ibrido (keyword + semantico)

Combina una ricerca per parole chiave (BM25), che cattura codici prodotto, nomi propri e termini rari esatti, con una ricerca semantica vettoriale che cattura riformulazioni e concetti, fondendo i due risultati per rango (RRF) per recuperare ciò che nessuno dei due, da solo, troverebbe.

03

Riordino su una shortlist

Un reranker cross-encoder riordina solo la rosa ristretta dei candidati migliori valutando domanda e passaggio insieme anziché separatamente, aggiungendo uno stadio di precisione che è accurato proprio perché opera su pochi frammenti e non sull'intero indice.

04

Generazione ancorata con citazioni

Il modello risponde unicamente dai passaggi in cima alla rosa e cita la fonte di ogni affermazione, così ogni frase resta riconducibile a un documento, una versione e una sezione invece di affondare nella memoria di addestramento.

05

Verifica di ancoraggio e pertinenza / astensione

Prima della consegna un controllo di grounding e rilevanza confronta la risposta con i passaggi recuperati: sotto soglia il sistema si astiene, rilancia il retrieval o passa la mano a una persona, perché un "non è nelle fonti" onesto vale più di un'invenzione plausibile.

06

Valutazione della qualità della risposta e freschezza

In continuo si misurano fedeltà, pertinenza del contesto, pertinenza della risposta, accuratezza delle citazioni e freshness dell'indice, perché un singolo punteggio nasconde dove sta il problema e una base affidabile va tenuta onesta mentre documenti e permessi cambiano.

Quando serve

I segnali di una knowledge base che inventa

Un assistente che risponde con sicurezza è inutile se la sicurezza non è ancorata a una fonte. Questi sono i sintomi che vediamo prima di intervenire.

  • Risposte sicure ma sbagliate. Il sistema afferma con tono assertivo cose non presenti in nessun documento aziendale: è grounding mancante, non un errore di battitura.
  • Nessuna citazione verificabile. L'utente non può risalire alla fonte di una frase, quindi non può fidarsi né correggere; ogni risposta è una scatola nera.
  • Contenuti obsoleti spacciati per attuali. Una policy aggiornata la settimana scorsa non è ancora nell'indice, e il sistema continua a citare la versione vecchia con la stessa sicurezza.
  • Perdite di perimetro. Un utente riceve in risposta frammenti di documenti che nel sistema sorgente non avrebbe il diritto di vedere.
  • Domande fuori scope senza freno. Quando le fonti non bastano, il modello riempie il vuoto inventando invece di dichiarare che non lo sa.

Per chi gestisce documentazione critica, supporto, compliance o knowledge interno e non può permettersi una risposta inventata davanti a un cliente o a un auditor.

Il principio

Recuperare prima, generare dopo

Un modello generativo lasciato a sé predice testo plausibile. Una knowledge base RAG inverte l'ordine: prima recupera l'evidenza dalle fonti aziendali, poi obbliga il modello a rispondere solo entro quell'evidenza.

Retrieval-Augmented Generation

Prima della risposta, il sistema cerca nei documenti i passaggi rilevanti e li passa al modello come contesto, con l'istruzione di rispondere unicamente da lì. Il modello smette di attingere alla memoria di addestramento e attinge alla vostra fonte.

Grounding ≠ correttezza

Il grounding verifica che la risposta sia fedele al testo recuperato, non che sia vera in assoluto. Se il retrieval pesca il frammento sbagliato, un alto punteggio di grounding significa solo che il modello ha ripetuto fedelmente la cosa sbagliata: per questo retrieval e valutazione vanno trattati come due problemi distinti.

Source-of-truth, non copia

L'indice non sostituisce i sistemi sorgente: li riflette. Quando un documento cambia all'origine, l'indice deve cambiare di conseguenza, altrimenti la knowledge base mente con sicurezza su ciò che è vero oggi.

Astenersi è una funzione, non un difetto

Una base di conoscenza affidabile sa dire "questa informazione non è nelle fonti". È preferibile un'astensione onesta a una risposta inventata: il valore enterprise sta nel non sbagliare, non nel rispondere sempre.

Come si costruisce

Dalla fonte alla risposta citata

Ogni strato restringe ciò che il modello può dire. La pipeline non è un singolo modello: è una catena di controlli, ognuno con un compito misurabile.

1
Ingestione e chunking

I documenti vengono normalizzati e spezzati in frammenti coerenti, dimensionati per tipo di contenuto: una policy si segmenta diversamente da una scheda tecnica. A ogni frammento si attaccano i metadati di origine — titolo, sezione, data, permessi — che diventano la base delle citazioni e del controllo accessi.

2
Retrieval ibrido

Una ricerca per parole chiave (BM25) cattura codici prodotto, nomi propri e termini rari esatti; una ricerca semantica vettoriale cattura le riformulazioni e i concetti. I due risultati si fondono per rango (RRF), recuperando ciò che nessuno dei due, da solo, troverebbe.

3
Reranking sulla rosa

Un reranker cross-encoder ordina i pochi candidati migliori valutando domanda e passaggio insieme, non separatamente. È un secondo stadio di precisione che opera su una rosa ristretta, non sull'intero indice: per questo è accurato senza essere lento.

4
Generazione ancorata con citazioni

Il modello risponde solo dai passaggi in cima alla rosa e cita la fonte di ogni affermazione. Prima della consegna, un controllo di grounding e rilevanza confronta la risposta con i passaggi: sotto soglia, il sistema si astiene o rilancia il retrieval invece di pubblicare.

Dalla fonte alla risposta citata in millisecondi, con ogni affermazione riconducibile a un passaggio.

Cosa misuriamo

Le metriche che distinguono una base affidabile

Una knowledge base si valuta su dimensioni separate, perché un singolo punteggio nasconde dove sta il problema. Queste sono le leve che monitoriamo in continuo.

DimensioneCosa verificaPerché conta
Faithfulness (fedeltà)Ogni affermazione della risposta è sostenuta dai passaggi recuperatiÈ il freno diretto alle allucinazioni: niente fonte, niente affermazione
Context relevanceI passaggi recuperati sono effettivamente pertinenti alla domandaMisura il retrieval: se è scarso, anche una risposta fedele è fedele alla cosa sbagliata
Answer relevanceLa risposta affronta davvero la domanda posta, senza divagareDistingue il pertinente dal genericamente corretto ma inutile
Accuratezza delle citazioniOgni citazione punta al passaggio che davvero supporta la fraseRende la risposta verificabile: l'utente risale alla fonte e controlla
FreshnessL'indice riflette lo stato attuale dei documenti sorgenteUn indice stantio produce risposte sicure ma sbagliate oggi
Garanzie operative

I controlli che teniamo accesi in produzione

Costruire la pipeline è metà del lavoro. L'altra metà è mantenerla onesta nel tempo, mentre documenti, permessi e domande cambiano.

01

Controllo accessi nel retrieval

I permessi sono un filtro sui metadati al momento della ricerca: un documento che l'utente non può vedere all'origine non compare mai tra i risultati. Il perimetro di sicurezza viaggia con il dato.

02

Indicizzazione incrementale

Quando una fonte cambia, si rielabora solo ciò che è cambiato e si aggiorna l'indice con identificatori stabili. Niente ricostruzioni totali, niente finestre in cui la base risponde su versioni vecchie.

03

Soglie di astensione

Sotto la soglia di grounding o di rilevanza la risposta non parte: il sistema dichiara di non sapere, rilancia il retrieval o passa la mano a una persona. La regola di scope è esplicita, non lasciata al caso.

04

Provenienza e source-of-truth

Ogni risposta porta con sé l'origine delle affermazioni — quale documento, quale versione, quale sezione — nello spirito degli standard aperti di provenienza dei contenuti come C2PA: la storia di un'affermazione è verificabile.

Una knowledge base affidabile non è quella che risponde sempre, ma quella che non risponde quando non deve.

Domande dirette

Quello che ci chiedono prima di partire

Il RAG elimina del tutto le allucinazioni?

No, e diffidate di chi lo promette. Le riduce in modo sostanziale ancorando ogni risposta a fonti reali, e i controlli di grounding e le soglie di astensione fermano le risposte non supportate prima che escano. L'obiettivo è una risposta verificabile, non un atto di fede.

Cosa succede quando la risposta non è nei documenti?

Il sistema lo dichiara. Definiamo con voi la regola di scope: astensione esplicita, rilancio del retrieval o escalation a una persona. È preferibile un "non è nelle fonti" onesto a un'invenzione plausibile.

Come restano aggiornate le risposte?

Con indicizzazione incrementale: quando un documento cambia all'origine, l'indice si aggiorna solo per la parte cambiata, senza ricostruzioni complete. La freshness è una metrica che monitoriamo, non un evento sporadico.

Casi

Dal problema al risultato — anonimi.

Assicurazioni · anonimo

Polizze citate, non immaginate

Problema L'assistente al supporto rispondeva con sicurezza su clausole e massimali attingendo a versioni di polizza superate, senza modo per l'operatore di risalire alla fonte della frase.

Metodo Ingestione source-of-truth con metadati di versione e sezione, retrieval ibrido sulle condizioni contrattuali, generazione ancorata che cita ogni clausola e soglia di astensione quando il passaggio non sostiene la risposta.

Risultato Ogni risposta porta con sé documento, versione e sezione; quando l'informazione non è nelle fonti il sistema lo dichiara invece di inventare, e l'operatore può verificare prima di parlare al cliente.

Industria · anonimo

Schede tecniche senza perdite di perimetro

Problema La knowledge base interna restituiva a tecnici di reparti diversi frammenti di documentazione riservata che nel sistema sorgente non avrebbero avuto il diritto di vedere.

Metodo Controllo accessi come filtro sui metadati al momento del retrieval — il perimetro di sicurezza viaggia con il dato — più chunking per tipo di contenuto che segmenta una scheda tecnica diversamente da una procedura.

Risultato Un documento che l'utente non può vedere all'origine non compare mai tra i risultati; le risposte restano citate e verificabili senza esporre materiale fuori perimetro.

Sanità · anonimo

Procedure aggiornate alla settimana giusta

Problema Le procedure cliniche cambiavano spesso, ma l'indice ricostruito a intervalli lasciava finestre in cui il sistema citava la versione vecchia con la stessa sicurezza di quella corrente.

Metodo Indicizzazione incrementale con identificatori stabili che rielabora solo ciò che cambia all'origine, più la freshness trattata come metrica monitorata in continuo accanto a fedeltà e accuratezza delle citazioni.

Risultato Niente ricostruzioni totali e niente finestre di disallineamento: l'indice riflette lo stato attuale dei documenti e le risposte smettono di essere sicure ma sbagliate oggi.

Approfondisci ancora

Portiamolo nel tuo stack.