AI Solutions · Vertiefung
RAG-Wissensdatenbank: Antworten, die in Quellen verankert und nie erfunden sind
Wir bauen Wissensdatenbanken, die ausschließlich aus verifizierten Quellen antworten: hybrider Retrieval, Grounding auf Dokumenten, nachvollziehbare Zitate, Halluzinationskontrolle und kontinuierliche Bewertung der Antwortqualität. Reicht die Quelle nicht aus, sagt das System es, statt zu erfinden.
WISSENSBASIS · GROUNDED RETRIEVAL
Rein · Nutzerfrage
Raus · Zitierte, überprüfbare Antwort
Source-of-Truth-Ingestion & Chunking
Normalisiert die Quelldokumente und zerlegt sie in kohärente, nach Inhaltstyp dimensionierte Fragmente, wobei jedem Quellmetadaten angehängt werden — Titel, Abschnitt, Datum, Berechtigungen —, die zur Grundlage von Zitaten und Zugriffskontrolle werden: Ohne saubere Ingestion zitiert alles Nachgelagerte ins Leere.
Hybrides Retrieval (Keyword + semantisch)
Kombiniert eine Stichwortsuche (BM25), die Produktcodes, Eigennamen und exakte seltene Begriffe erfasst, mit einer semantischen Vektorsuche, die Umformulierungen und Konzepte erfasst, und fusioniert die beiden Ergebnismengen nach Rang (RRF), um zu bergen, was keine von beiden allein fände.
Reranking auf einer Shortlist
Ein Cross-Encoder-Reranker ordnet nur die enge Auswahl der besten Kandidaten neu, indem er Frage und Passage gemeinsam statt getrennt bewertet, und fügt eine Präzisionsstufe hinzu, die gerade deshalb genau bleibt, weil sie an wenigen Fragmenten und nicht am gesamten Index arbeitet.
Fundierte Generierung mit Quellenangaben
Das Modell antwortet einzig aus der Spitze der engeren Auswahl und zitiert die Quelle jeder Aussage, sodass jeder Satz auf ein Dokument, eine Version und einen Abschnitt zurückführbar bleibt, statt im Trainingsgedächtnis zu versinken.
Grounding- & Relevanzprüfung / Enthaltung
Vor der Auslieferung vergleicht eine Grounding- und Relevanzprüfung die Antwort mit den abgerufenen Passagen: unterhalb der Schwelle enthält sich das System, ruft erneut ab oder übergibt an einen Menschen, denn ein ehrliches "das steht nicht in den Quellen" ist mehr wert als eine plausible Erfindung.
Antwortqualitäts-Evaluation & Aktualität
Faithfulness, Context Relevance, Answer Relevance, Zitiergenauigkeit und Index-Freshness werden kontinuierlich gemessen, denn ein einzelner Wert verbirgt, wo das Problem liegt, und eine zuverlässige Basis muss ehrlich gehalten werden, während sich Dokumente und Berechtigungen ändern.
Die Anzeichen einer Wissensdatenbank, die erfindet
Ein Assistent, der mit Überzeugung antwortet, ist wertlos, wenn diese Überzeugung nicht in einer Quelle verankert ist. Das sind die Symptome, die wir sehen, bevor wir eingreifen.
- Überzeugt, aber falsch. Das System behauptet in autoritativem Ton Dinge, die in keinem internen Dokument vorkommen: Das ist fehlendes Grounding, kein Tippfehler.
- Keine überprüfbaren Zitate. Der Nutzer kann einen Satz nicht auf seine Quelle zurückführen und ihm daher weder vertrauen noch ihn korrigieren; jede Antwort ist eine Blackbox.
- Veraltete Inhalte als aktuell ausgegeben. Eine letzte Woche aktualisierte Richtlinie ist noch nicht im Index, und das System zitiert weiterhin die alte Version mit derselben Überzeugung.
- Perimeter-Lecks. Ein Nutzer erhält Fragmente von Dokumenten, die er im Quellsystem gar nicht sehen dürfte.
- Themenfremde Fragen ohne Bremse. Wenn die Quellen nicht ausreichen, füllt das Modell die Lücke mit Erfindungen, statt zu erklären, dass es die Antwort nicht kennt.
Für Teams, die kritische Dokumentation, Support, Compliance oder internes Wissen verwalten und sich vor einem Kunden oder einem Prüfer keine erfundene Antwort leisten können.
Erst abrufen, dann generieren
Ein sich selbst überlassenes generatives Modell sagt plausiblen Text voraus. Eine RAG-Wissensdatenbank kehrt die Reihenfolge um: Sie ruft zuerst die Belege aus Ihren Quellen ab und zwingt das Modell dann, nur innerhalb dieser Belege zu antworten.
Retrieval-Augmented Generation
Vor der Antwort durchsucht das System die Dokumente nach relevanten Passagen und übergibt sie dem Modell als Kontext, mit der Anweisung, nur von dort zu antworten. Das Modell greift nicht mehr auf das Trainingsgedächtnis zurück, sondern auf Ihre maßgebliche Quelle.
Grounding ≠ Korrektheit
Grounding prüft, ob die Antwort dem abgerufenen Text treu ist, nicht ob sie absolut wahr ist. Holt der Retrieval das falsche Fragment, bedeutet ein hoher Grounding-Wert nur, dass das Modell das Falsche getreu wiederholt hat — deshalb müssen Retrieval und Evaluation als zwei getrennte Probleme behandelt werden.
Source-of-Truth, keine Kopie
Der Index ersetzt Ihre Quellsysteme nicht; er spiegelt sie wider. Ändert sich ein Dokument an der Quelle, muss sich der Index mit ihm ändern, sonst lügt die Wissensdatenbank überzeugt über das, was heute wahr ist.
Sich zu enthalten ist ein Feature, kein Mangel
Eine zuverlässige Wissensdatenbank weiß zu sagen "das steht nicht in den Quellen". Eine ehrliche Enthaltung schlägt eine erfundene Antwort: Der Unternehmenswert liegt darin, nicht falsch zu liegen, nicht darin, immer zu antworten.
Von der Quelle zur zitierten Antwort
Jede Schicht engt ein, was das Modell sagen darf. Die Pipeline ist kein einzelnes Modell: Sie ist eine Kette von Kontrollen, jede mit einer messbaren Aufgabe.
Dokumente werden normalisiert und in kohärente Fragmente zerlegt, dimensioniert nach Inhaltstyp: Eine Richtlinie wird anders segmentiert als ein Datenblatt. Jedes Fragment trägt Quellmetadaten — Titel, Abschnitt, Datum, Berechtigungen — die zur Grundlage von Zitaten und Zugriffskontrolle werden.
Eine Stichwortsuche (BM25) erfasst Produktcodes, Eigennamen und exakte seltene Begriffe; eine semantische Vektorsuche erfasst Umformulierungen und Konzepte. Die beiden Ergebnismengen werden nach Rang fusioniert (RRF) und bergen, was keine von beiden allein fände.
Ein Cross-Encoder-Reranker ordnet die wenigen besten Kandidaten, indem er Frage und Passage gemeinsam statt getrennt bewertet. Es ist eine zweite Präzisionsstufe auf einer engeren Auswahl, nicht auf dem gesamten Index — deshalb ist sie genau, ohne langsam zu sein.
Das Modell antwortet nur aus der Spitze der engeren Auswahl und zitiert die Quelle jeder Aussage. Vor der Auslieferung vergleicht eine Grounding- und Relevanzprüfung die Antwort mit den Passagen: unterhalb der Schwelle enthält sich das System oder ruft erneut ab, statt zu veröffentlichen.
Von der Quelle zur zitierten Antwort in Millisekunden, mit jeder Aussage auf eine Passage zurückführbar.
Die Metriken, die eine zuverlässige Basis von einer plausiblen trennen
Eine Wissensdatenbank wird nach getrennten Dimensionen beurteilt, denn ein einzelner Wert verbirgt, wo das Problem liegt. Das sind die Hebel, die wir kontinuierlich überwachen.
| Dimension | Was sie prüft | Warum sie zählt |
|---|---|---|
| Faithfulness (Treue) | Jede Aussage der Antwort wird durch die abgerufenen Passagen gestützt | Die direkte Bremse gegen Halluzinationen: keine Quelle, keine Aussage |
| Context Relevance | Die abgerufenen Passagen sind tatsächlich für die Frage relevant | Misst den Retrieval: ist er schlecht, ist selbst eine treue Antwort dem Falschen treu |
| Answer Relevance | Die Antwort geht wirklich auf die gestellte Frage ein, ohne abzuschweifen | Trennt das Relevante vom generisch Richtigen, aber Nutzlosen |
| Zitiergenauigkeit | Jedes Zitat verweist auf die Passage, die den Satz tatsächlich stützt | Macht die Antwort überprüfbar: Der Nutzer geht zur Quelle zurück und prüft |
| Freshness | Der Index spiegelt den aktuellen Stand der Quelldokumente wider | Ein veralteter Index erzeugt heute überzeugte, aber falsche Antworten |
Die Kontrollen, die wir in der Produktion laufen lassen
Die Pipeline zu bauen ist die halbe Arbeit. Die andere Hälfte besteht darin, sie über die Zeit ehrlich zu halten, während sich Dokumente, Berechtigungen und Fragen ändern.
Zugriffskontrolle im Retrieval
Berechtigungen sind ein Metadatenfilter zum Suchzeitpunkt: Ein Dokument, das ein Nutzer an der Quelle nicht sehen darf, erscheint nie in den Ergebnissen. Der Sicherheitsperimeter reist mit den Daten.
Inkrementelle Indexierung
Ändert sich eine Quelle, wird nur das Geänderte neu verarbeitet und der Index mit stabilen Bezeichnern aktualisiert. Keine kompletten Neuaufbauten, keine Fenster, in denen die Basis aus alten Versionen antwortet.
Enthaltungsschwellen
Unterhalb der Grounding- oder Relevanzschwelle geht die Antwort nicht raus: Das System erklärt, dass es nicht weiß, ruft erneut ab oder übergibt an einen Menschen. Die Scope-Regel ist explizit, nicht dem Zufall überlassen.
Provenienz und Source-of-Truth
Jede Antwort trägt die Herkunft ihrer Aussagen mit sich — welches Dokument, welche Version, welcher Abschnitt — im Sinne offener Standards zur Inhaltsprovenienz wie C2PA: Die Geschichte einer Aussage ist überprüfbar.
Eine zuverlässige Wissensdatenbank ist nicht die, die immer antwortet — es ist die, die nicht antwortet, wenn sie nicht sollte.
Was Teams fragen, bevor wir starten
Beseitigt RAG Halluzinationen vollständig?
Nein, und seien Sie misstrauisch gegenüber jedem, der das verspricht. Es reduziert sie erheblich, indem es jede Antwort an echte Quellen verankert, und Grounding-Prüfungen plus Enthaltungsschwellen stoppen ungestützte Antworten, bevor sie rausgehen. Das Ziel ist eine überprüfbare Antwort, kein Glaubensakt.
Was passiert, wenn die Antwort nicht in den Dokumenten steht?
Das System sagt es. Wir definieren mit Ihnen die Scope-Regel: explizite Enthaltung, erneuter Abruf oder Eskalation an einen Menschen. Ein ehrliches "das steht nicht in den Quellen" schlägt eine plausible Erfindung.
Wie bleiben die Antworten aktuell?
Durch inkrementelle Indexierung: Ändert sich ein Dokument an der Quelle, aktualisiert sich der Index nur für den geänderten Teil, ohne kompletten Neuaufbau. Freshness ist eine Metrik, die wir überwachen, kein gelegentliches Ereignis.
Fallnotizen
Vom Problem zum Ergebnis — anonymisiert.
Policen zitiert, nicht erdacht
Problem Der Support-Assistent antwortete überzeugt zu Klauseln und Deckungsgrenzen, griff dabei aber auf überholte Policenversionen zurück, ohne dass der Mitarbeiter einen Satz auf seine Quelle zurückführen konnte.
Methode Source-of-Truth-Ingestion mit Versions- und Abschnittsmetadaten, hybrider Retrieval über die Vertragsbedingungen, verankerte Generierung, die jede Klausel zitiert, und eine Enthaltungsschwelle, wenn die Passage die Antwort nicht stützt.
Ergebnis Jede Antwort trägt ihr Dokument, ihre Version und ihren Abschnitt mit sich; steht die Information nicht in den Quellen, sagt das System es, statt zu erfinden, und der Mitarbeiter kann prüfen, bevor er mit dem Kunden spricht.
Datenblätter ohne Perimeter-Lecks
Problem Die interne Wissensdatenbank lieferte Technikern verschiedener Abteilungen Fragmente vertraulicher Dokumentation, die sie im Quellsystem gar nicht hätten sehen dürfen.
Methode Zugriffskontrolle als Metadatenfilter zum Retrieval-Zeitpunkt — der Sicherheitsperimeter reist mit den Daten — plus Chunking nach Inhaltstyp, das ein Datenblatt anders segmentiert als eine Verfahrensanweisung.
Ergebnis Ein Dokument, das ein Nutzer an der Quelle nicht sehen darf, erscheint nie in den Ergebnissen; die Antworten bleiben zitiert und überprüfbar, ohne Material außerhalb des Perimeters offenzulegen.
Verfahren aktuell zur richtigen Woche
Problem Klinische Verfahren änderten sich oft, doch ein nach Zeitplan neu aufgebauter Index ließ Fenster, in denen das System die alte Version mit derselben Überzeugung wie die aktuelle zitierte.
Methode Inkrementelle Indexierung mit stabilen Bezeichnern, die nur das an der Quelle Geänderte neu verarbeitet, plus Freshness als kontinuierlich überwachte Metrik neben Faithfulness und Zitiergenauigkeit.
Ergebnis Keine kompletten Neuaufbauten und keine Drift-Fenster: Der Index spiegelt den aktuellen Stand der Dokumente wider, und die Antworten hören auf, heute überzeugt, aber falsch zu sein.
Tiefer eintauchen
Vom Index zum produktiven Produkt→
Verankerter Retrieval ist eine Schicht — die anderen fünf, die echten Traffic überstehen.
Die Adoption steuern, nicht nur die Pipeline→
Wer was fragen darf, mit welchen Berechtigungen und welchen expliziten Scope-Regeln.
Überprüfbare Provenienz von Aussagen→
Die Herkunft eines Outputs nachverfolgen, im Sinne offener Standards wie C2PA.