Zum Inhalt springen

AI Solutions · Vertiefung

RAG-Wissensdatenbank: Antworten, die in Quellen verankert und nie erfunden sind

Wir bauen Wissensdatenbanken, die ausschließlich aus verifizierten Quellen antworten: hybrider Retrieval, Grounding auf Dokumenten, nachvollziehbare Zitate, Halluzinationskontrolle und kontinuierliche Bewertung der Antwortqualität. Reicht die Quelle nicht aus, sagt das System es, statt zu erfinden.

AI e Vokira — parole dentro, lavoro fuori

WISSENSBASIS · GROUNDED RETRIEVAL

Rein · Nutzerfrage

Raus · Zitierte, überprüfbare Antwort

01

Source-of-Truth-Ingestion & Chunking

Normalisiert die Quelldokumente und zerlegt sie in kohärente, nach Inhaltstyp dimensionierte Fragmente, wobei jedem Quellmetadaten angehängt werden — Titel, Abschnitt, Datum, Berechtigungen —, die zur Grundlage von Zitaten und Zugriffskontrolle werden: Ohne saubere Ingestion zitiert alles Nachgelagerte ins Leere.

02

Hybrides Retrieval (Keyword + semantisch)

Kombiniert eine Stichwortsuche (BM25), die Produktcodes, Eigennamen und exakte seltene Begriffe erfasst, mit einer semantischen Vektorsuche, die Umformulierungen und Konzepte erfasst, und fusioniert die beiden Ergebnismengen nach Rang (RRF), um zu bergen, was keine von beiden allein fände.

03

Reranking auf einer Shortlist

Ein Cross-Encoder-Reranker ordnet nur die enge Auswahl der besten Kandidaten neu, indem er Frage und Passage gemeinsam statt getrennt bewertet, und fügt eine Präzisionsstufe hinzu, die gerade deshalb genau bleibt, weil sie an wenigen Fragmenten und nicht am gesamten Index arbeitet.

04

Fundierte Generierung mit Quellenangaben

Das Modell antwortet einzig aus der Spitze der engeren Auswahl und zitiert die Quelle jeder Aussage, sodass jeder Satz auf ein Dokument, eine Version und einen Abschnitt zurückführbar bleibt, statt im Trainingsgedächtnis zu versinken.

05

Grounding- & Relevanzprüfung / Enthaltung

Vor der Auslieferung vergleicht eine Grounding- und Relevanzprüfung die Antwort mit den abgerufenen Passagen: unterhalb der Schwelle enthält sich das System, ruft erneut ab oder übergibt an einen Menschen, denn ein ehrliches "das steht nicht in den Quellen" ist mehr wert als eine plausible Erfindung.

06

Antwortqualitäts-Evaluation & Aktualität

Faithfulness, Context Relevance, Answer Relevance, Zitiergenauigkeit und Index-Freshness werden kontinuierlich gemessen, denn ein einzelner Wert verbirgt, wo das Problem liegt, und eine zuverlässige Basis muss ehrlich gehalten werden, während sich Dokumente und Berechtigungen ändern.

Wann Sie das brauchen

Die Anzeichen einer Wissensdatenbank, die erfindet

Ein Assistent, der mit Überzeugung antwortet, ist wertlos, wenn diese Überzeugung nicht in einer Quelle verankert ist. Das sind die Symptome, die wir sehen, bevor wir eingreifen.

  • Überzeugt, aber falsch. Das System behauptet in autoritativem Ton Dinge, die in keinem internen Dokument vorkommen: Das ist fehlendes Grounding, kein Tippfehler.
  • Keine überprüfbaren Zitate. Der Nutzer kann einen Satz nicht auf seine Quelle zurückführen und ihm daher weder vertrauen noch ihn korrigieren; jede Antwort ist eine Blackbox.
  • Veraltete Inhalte als aktuell ausgegeben. Eine letzte Woche aktualisierte Richtlinie ist noch nicht im Index, und das System zitiert weiterhin die alte Version mit derselben Überzeugung.
  • Perimeter-Lecks. Ein Nutzer erhält Fragmente von Dokumenten, die er im Quellsystem gar nicht sehen dürfte.
  • Themenfremde Fragen ohne Bremse. Wenn die Quellen nicht ausreichen, füllt das Modell die Lücke mit Erfindungen, statt zu erklären, dass es die Antwort nicht kennt.

Für Teams, die kritische Dokumentation, Support, Compliance oder internes Wissen verwalten und sich vor einem Kunden oder einem Prüfer keine erfundene Antwort leisten können.

Das Prinzip

Erst abrufen, dann generieren

Ein sich selbst überlassenes generatives Modell sagt plausiblen Text voraus. Eine RAG-Wissensdatenbank kehrt die Reihenfolge um: Sie ruft zuerst die Belege aus Ihren Quellen ab und zwingt das Modell dann, nur innerhalb dieser Belege zu antworten.

Retrieval-Augmented Generation

Vor der Antwort durchsucht das System die Dokumente nach relevanten Passagen und übergibt sie dem Modell als Kontext, mit der Anweisung, nur von dort zu antworten. Das Modell greift nicht mehr auf das Trainingsgedächtnis zurück, sondern auf Ihre maßgebliche Quelle.

Grounding ≠ Korrektheit

Grounding prüft, ob die Antwort dem abgerufenen Text treu ist, nicht ob sie absolut wahr ist. Holt der Retrieval das falsche Fragment, bedeutet ein hoher Grounding-Wert nur, dass das Modell das Falsche getreu wiederholt hat — deshalb müssen Retrieval und Evaluation als zwei getrennte Probleme behandelt werden.

Source-of-Truth, keine Kopie

Der Index ersetzt Ihre Quellsysteme nicht; er spiegelt sie wider. Ändert sich ein Dokument an der Quelle, muss sich der Index mit ihm ändern, sonst lügt die Wissensdatenbank überzeugt über das, was heute wahr ist.

Sich zu enthalten ist ein Feature, kein Mangel

Eine zuverlässige Wissensdatenbank weiß zu sagen "das steht nicht in den Quellen". Eine ehrliche Enthaltung schlägt eine erfundene Antwort: Der Unternehmenswert liegt darin, nicht falsch zu liegen, nicht darin, immer zu antworten.

Wie es gebaut wird

Von der Quelle zur zitierten Antwort

Jede Schicht engt ein, was das Modell sagen darf. Die Pipeline ist kein einzelnes Modell: Sie ist eine Kette von Kontrollen, jede mit einer messbaren Aufgabe.

1
Ingestion und Chunking

Dokumente werden normalisiert und in kohärente Fragmente zerlegt, dimensioniert nach Inhaltstyp: Eine Richtlinie wird anders segmentiert als ein Datenblatt. Jedes Fragment trägt Quellmetadaten — Titel, Abschnitt, Datum, Berechtigungen — die zur Grundlage von Zitaten und Zugriffskontrolle werden.

2
Hybrider Retrieval

Eine Stichwortsuche (BM25) erfasst Produktcodes, Eigennamen und exakte seltene Begriffe; eine semantische Vektorsuche erfasst Umformulierungen und Konzepte. Die beiden Ergebnismengen werden nach Rang fusioniert (RRF) und bergen, was keine von beiden allein fände.

3
Reranking der engeren Auswahl

Ein Cross-Encoder-Reranker ordnet die wenigen besten Kandidaten, indem er Frage und Passage gemeinsam statt getrennt bewertet. Es ist eine zweite Präzisionsstufe auf einer engeren Auswahl, nicht auf dem gesamten Index — deshalb ist sie genau, ohne langsam zu sein.

4
Verankerte Generierung mit Zitaten

Das Modell antwortet nur aus der Spitze der engeren Auswahl und zitiert die Quelle jeder Aussage. Vor der Auslieferung vergleicht eine Grounding- und Relevanzprüfung die Antwort mit den Passagen: unterhalb der Schwelle enthält sich das System oder ruft erneut ab, statt zu veröffentlichen.

Von der Quelle zur zitierten Antwort in Millisekunden, mit jeder Aussage auf eine Passage zurückführbar.

Was wir messen

Die Metriken, die eine zuverlässige Basis von einer plausiblen trennen

Eine Wissensdatenbank wird nach getrennten Dimensionen beurteilt, denn ein einzelner Wert verbirgt, wo das Problem liegt. Das sind die Hebel, die wir kontinuierlich überwachen.

DimensionWas sie prüftWarum sie zählt
Faithfulness (Treue)Jede Aussage der Antwort wird durch die abgerufenen Passagen gestütztDie direkte Bremse gegen Halluzinationen: keine Quelle, keine Aussage
Context RelevanceDie abgerufenen Passagen sind tatsächlich für die Frage relevantMisst den Retrieval: ist er schlecht, ist selbst eine treue Antwort dem Falschen treu
Answer RelevanceDie Antwort geht wirklich auf die gestellte Frage ein, ohne abzuschweifenTrennt das Relevante vom generisch Richtigen, aber Nutzlosen
ZitiergenauigkeitJedes Zitat verweist auf die Passage, die den Satz tatsächlich stütztMacht die Antwort überprüfbar: Der Nutzer geht zur Quelle zurück und prüft
FreshnessDer Index spiegelt den aktuellen Stand der Quelldokumente widerEin veralteter Index erzeugt heute überzeugte, aber falsche Antworten
Operative Garantien

Die Kontrollen, die wir in der Produktion laufen lassen

Die Pipeline zu bauen ist die halbe Arbeit. Die andere Hälfte besteht darin, sie über die Zeit ehrlich zu halten, während sich Dokumente, Berechtigungen und Fragen ändern.

01

Zugriffskontrolle im Retrieval

Berechtigungen sind ein Metadatenfilter zum Suchzeitpunkt: Ein Dokument, das ein Nutzer an der Quelle nicht sehen darf, erscheint nie in den Ergebnissen. Der Sicherheitsperimeter reist mit den Daten.

02

Inkrementelle Indexierung

Ändert sich eine Quelle, wird nur das Geänderte neu verarbeitet und der Index mit stabilen Bezeichnern aktualisiert. Keine kompletten Neuaufbauten, keine Fenster, in denen die Basis aus alten Versionen antwortet.

03

Enthaltungsschwellen

Unterhalb der Grounding- oder Relevanzschwelle geht die Antwort nicht raus: Das System erklärt, dass es nicht weiß, ruft erneut ab oder übergibt an einen Menschen. Die Scope-Regel ist explizit, nicht dem Zufall überlassen.

04

Provenienz und Source-of-Truth

Jede Antwort trägt die Herkunft ihrer Aussagen mit sich — welches Dokument, welche Version, welcher Abschnitt — im Sinne offener Standards zur Inhaltsprovenienz wie C2PA: Die Geschichte einer Aussage ist überprüfbar.

Eine zuverlässige Wissensdatenbank ist nicht die, die immer antwortet — es ist die, die nicht antwortet, wenn sie nicht sollte.

Klare Antworten

Was Teams fragen, bevor wir starten

Beseitigt RAG Halluzinationen vollständig?

Nein, und seien Sie misstrauisch gegenüber jedem, der das verspricht. Es reduziert sie erheblich, indem es jede Antwort an echte Quellen verankert, und Grounding-Prüfungen plus Enthaltungsschwellen stoppen ungestützte Antworten, bevor sie rausgehen. Das Ziel ist eine überprüfbare Antwort, kein Glaubensakt.

Was passiert, wenn die Antwort nicht in den Dokumenten steht?

Das System sagt es. Wir definieren mit Ihnen die Scope-Regel: explizite Enthaltung, erneuter Abruf oder Eskalation an einen Menschen. Ein ehrliches "das steht nicht in den Quellen" schlägt eine plausible Erfindung.

Wie bleiben die Antworten aktuell?

Durch inkrementelle Indexierung: Ändert sich ein Dokument an der Quelle, aktualisiert sich der Index nur für den geänderten Teil, ohne kompletten Neuaufbau. Freshness ist eine Metrik, die wir überwachen, kein gelegentliches Ereignis.

Fallnotizen

Vom Problem zum Ergebnis — anonymisiert.

Versicherung · anonymisiert

Policen zitiert, nicht erdacht

Problem Der Support-Assistent antwortete überzeugt zu Klauseln und Deckungsgrenzen, griff dabei aber auf überholte Policenversionen zurück, ohne dass der Mitarbeiter einen Satz auf seine Quelle zurückführen konnte.

Methode Source-of-Truth-Ingestion mit Versions- und Abschnittsmetadaten, hybrider Retrieval über die Vertragsbedingungen, verankerte Generierung, die jede Klausel zitiert, und eine Enthaltungsschwelle, wenn die Passage die Antwort nicht stützt.

Ergebnis Jede Antwort trägt ihr Dokument, ihre Version und ihren Abschnitt mit sich; steht die Information nicht in den Quellen, sagt das System es, statt zu erfinden, und der Mitarbeiter kann prüfen, bevor er mit dem Kunden spricht.

Industrie · anonymisiert

Datenblätter ohne Perimeter-Lecks

Problem Die interne Wissensdatenbank lieferte Technikern verschiedener Abteilungen Fragmente vertraulicher Dokumentation, die sie im Quellsystem gar nicht hätten sehen dürfen.

Methode Zugriffskontrolle als Metadatenfilter zum Retrieval-Zeitpunkt — der Sicherheitsperimeter reist mit den Daten — plus Chunking nach Inhaltstyp, das ein Datenblatt anders segmentiert als eine Verfahrensanweisung.

Ergebnis Ein Dokument, das ein Nutzer an der Quelle nicht sehen darf, erscheint nie in den Ergebnissen; die Antworten bleiben zitiert und überprüfbar, ohne Material außerhalb des Perimeters offenzulegen.

Gesundheitswesen · anonymisiert

Verfahren aktuell zur richtigen Woche

Problem Klinische Verfahren änderten sich oft, doch ein nach Zeitplan neu aufgebauter Index ließ Fenster, in denen das System die alte Version mit derselben Überzeugung wie die aktuelle zitierte.

Methode Inkrementelle Indexierung mit stabilen Bezeichnern, die nur das an der Quelle Geänderte neu verarbeitet, plus Freshness als kontinuierlich überwachte Metrik neben Faithfulness und Zitiergenauigkeit.

Ergebnis Keine kompletten Neuaufbauten und keine Drift-Fenster: Der Index spiegelt den aktuellen Stand der Dokumente wider, und die Antworten hören auf, heute überzeugt, aber falsch zu sein.

Tiefer eintauchen

Bringen wir das in Ihren Stack.