AI Products · Vertiefung
Architektur eines KI-Produkts in Produktion: von den Daten bis zu den Guardrails
Die sechs Schichten, die aus einem Prototyp ein verlässliches KI-Produkt machen: governte Ingestion, messbares Retrieval, deterministische Orchestrierung, Evals in der CI, durchgängige Guardrails und Kontrolle über Kosten und Latenz.
KI-PRODUKT · PRODUKTIONSARCHITEKTUR
Rein · Rohe Anfrage + Quellen
Raus · Eine Antwort, die man ausliefern, nachvollziehen und der man vertrauen kann
Daten & Ingestion (Lineage, PII-Schwärzung)
Jedes Dokument kommt über strukturiertes Parsing, Sensibilitätsklassifikation und deterministische PII-Redaktion herein, bevor es das Modell erreicht, und jeder Chunk behält seine Verbindung zur Quelldatei, zur Policy-Version und zum erzeugenden Run: ohne diese Schicht übersteht keine Antwort ein Audit.
Retrieval (hybride Suche + Reranking)
Das Retrieval fusioniert semantische Vektorsuche und lexikalische BM25-Suche über Reciprocal Rank Fusion, dann ordnet ein Cross-Encoder-Reranker die Kandidaten neu, um die wirklich relevanten Passagen nach oben zu bringen: hier wird die Treue der Antwort gewonnen oder verloren.
Orchestrierung (begrenzter Agent, Tool-Calls)
Ein deterministischer Workflow entscheidet, wo du im Prozess stehst, während das Modell innerhalb einer begrenzten Menge von Aktionen wählt, was zu tun ist, mit Tool-Aufrufen über Standardprotokolle, dauerhafter Ausführung und Human-in-the-Loop bei wirkungsstarken Aktionen: der Agent bleibt auch unter Last vorhersehbar.
Evaluation & Observability (Evals in CI, Tracing)
Ein Golden Dataset aus realen Fehlern, an menschlichen Reviewern kalibrierte Grader und ein CI-Gate blockieren Regressionen vor dem Release, mit Traces, die offenen semantischen Konventionen (OpenTelemetry GenAI) folgen, um interoperabel und untersuchbar zu bleiben.
Guardrails & Sicherheit (Input/Output, Injection)
Guardrails validieren Eingabe, abgerufenen Kontext und Ausgabe durchgängig gegen Prompt Injection — die am häufigsten ausgenutzte Schwachstelle — indem sie den nicht vertrauenswürdigen Zwischenkontext klassifizieren und jede Aktion gegen die ursprüngliche Absicht des Nutzers bewerten.
Kosten & Latenz (Routing, Caching, TTFT)
Komplexitätsbasiertes Routing, semantisches Caching und Token-Budgets halten Kosten und Time-to-First-Token in Schach, mit Streaming für die wahrgenommene Latenz, sodass die Rechnung nicht explodiert und die Qualität nicht nachlässt, wenn der Traffic wächst.
Die Demo überzeugt, das Produkt bricht zusammen
Ein KI-Prototyp funktioniert, weil er auf bekannten Eingaben läuft, single-tenant, ohne feindlichen Traffic. Produktion schreibt jede Regel neu.
- Selbstsichere, aber falsche Antworten. Das Modell zitiert mit autoritärem Ton die falschen Dokumente: der Engpass ist das Retrieval, nicht die Generierung.
- Nicht reproduzierbares Verhalten. Dieselbe Eingabe liefert unterschiedliche Ergebnisse und niemand weiß warum, weil es weder Traces noch ein Regressionsdataset gibt.
- Kosten und Latenz außer Kontrolle. Wortreiche Prompts, kein Caching, kein Routing nach Komplexität: die Rechnung wächst und die Time-to-First-Token verschlechtert sich unter Last.
- Eine offene Angriffsfläche. Feindliche Anweisungen, in einem Dokument oder einer Tool-Ausgabe versteckt, kapern den Agenten: Prompt Injection ist die am häufigsten ausgenutzte Schwachstelle.
- Keine Nachvollziehbarkeit. Wenn ein Nutzer einen Fehler meldet, lässt sich nicht zum Quelldokument, zum Chunk und zum Run zurückverfolgen, die ihn erzeugt haben.
Für Teams, die eine KI vom Proof of Concept zu einem Produktionssystem führen, mit Audits, SLAs und Kostenobergrenzen.
Was aus einem Prototyp ein echtes Produkt macht
Ein KI-Produkt in Produktion ist ein verteiltes System, in dem das Modell nur der Planer ist. Sechs Schichten tragen es.
Daten und Ingestion
Dokumente kommen über strukturiertes Parsing, Sensibilitätsklassifikation und deterministische PII-Redaktion herein, bevor sie das Modell erreichen. Jede Ausgabe lässt sich zur Quelldatei, zur Policy-Version und zum erzeugenden Run zurückverfolgen.
Retrieval
Der Abruf kombiniert semantische Suche (Vektoren) und lexikalische Suche (BM25), fusioniert über Reciprocal Rank Fusion, dann ordnet ein Cross-Encoder-Reranker die Kandidaten neu. Hier wird die Treue der Antwort gewonnen oder verloren.
Orchestrierung und Agenten
Ein deterministischer Workflow entscheidet, wo du im Prozess stehst; das Modell entscheidet, was innerhalb einer begrenzten Menge von Aktionen zu tun ist. Tool-Aufrufe laufen über Standardprotokolle, mit dauerhafter Ausführung und Human-in-the-Loop bei wirkungsstarken Aktionen.
Evaluierung und Observability
Ein Golden Dataset aus realen Fehlern, an menschlichen Reviewern kalibrierte Grader und ein CI-Gate, das Regressionen vor dem Release blockiert. Traces folgen offenen semantischen Konventionen (OpenTelemetry GenAI), um interoperabel zu bleiben.
Guardrails und Kosten
Guardrails validieren Eingabe, abgerufenen Kontext und Ausgabe durchgängig gegen Prompt Injection; komplexitätsbasiertes Routing, semantisches Caching und Token-Budgets halten Kosten und Latenz in Schach, ohne die Qualität zu mindern.
Die Reise einer einzelnen Anfrage
Was eine Anfrage durchläuft, wenn die Architektur vollständig ist, von der Datenschicht bis zur zurückgegebenen Antwort.
Das Dokument wird geparst, nach Sensibilität klassifiziert, von PII bereinigt und mit Zweck-Tags indexiert; jeder Chunk behält seine Verbindung zur Quelle.
Hybride Vektor- + Stichwortsuche, Rank-Fusion, dann Cross-Encoder-Reranking, um die wirklich relevanten Passagen nach oben zu bringen.
Der Orchestrator leitet die Anfrage weiter, ruft die nötigen Tools auf und hält den Agenten an kritischen Entscheidungspunkten an; jeder Aufruf wird protokolliert.
Ausgabe gegen Policy und Injection-Signale validiert, auf gesampelten Traces evaluiert, dann mit Caching und Streaming für die wahrgenommene Latenz zurückgegeben.
Sechs Schichten pro Anfrage durchlaufen, jede messbar und unabhängig nachvollziehbar.
Wo sich alles ändert
Gleiches Modell, andere Welt. Der Abstand liegt nicht im Prompt: er liegt in den Schichten darum herum.
| Dimension | Prototyp | Produkt in Produktion |
|---|---|---|
| Daten | Manuell hochgeladene Dateien | Governte Ingestion, PII redigiert, nachvollziehbare Lineage |
| Retrieval | Nur Vektorsuche | Hybrid + Reranking, Treue gemessen |
| Steuerung | Frei agierender Agent | Deterministischer Workflow, begrenzte Tools, Human-in-the-Loop |
| Qualität | Von Hand getestet | Evals in der CI auf einem Golden Dataset, Regressions-Gate |
| Sicherheit und Kosten | Keine Guardrails | Defense in Depth, Routing, Caching, Token-Budgets |
Der Wert der sechs Schichten
Das ist keine Architekturtheorie: es ist das, was es dir erlaubt, vor einem Kunden oder einem Audit deinen Namen unter eine Antwort zu setzen.
Antworten, die ein Audit überstehen
Jede Ausgabe lässt sich zum Dokument, zum Chunk und zur Policy-Version zurückverfolgen: erklärbar, reproduzierbar, verteidigbar.
Zuverlässigkeit unter echtem Traffic
Deterministische Orchestrierung und durchgängige Guardrails halten das Verhalten vorhersehbar, auch bei feindlichen, mandantenübergreifenden Eingaben.
Qualität, die nicht regrediert
Evals in der CI blockieren Verschlechterungen vor dem Release, nicht nach einer Nutzerbeschwerde.
Governte Kosten und Latenz
Komplexitätsbasiertes Routing, semantisches Caching und Token-Budgets halten Rechnung und Time-to-First-Token im großen Maßstab unter Kontrolle.
In Produktion ist ein Agent kein Prompt: er ist ein verteiltes System, in dem das Modell der Planer ist.
Was Kunden uns fragen
Warum ist die Antwort selbstsicher, aber falsch?
Fast immer liegt das Problem stromaufwärts: das Retrieval hat die falschen Dokumente hervorgebracht und das Modell hat eine wohlgeformte, aber auf der falschen Quelle gegründete Antwort erzeugt. Man behebt es mit hybridem Retrieval, Reranking und Treuemessung, nicht mit dem Prompt.
Wie verteidigen wir uns gegen Prompt Injection?
Mit Defense in Depth: Eingabe und abgerufenen Kontext vor dem Modell klassifizieren, die Ausgabe gegen Policy validieren und jede Agentenaktion gegen die ursprüngliche Absicht des Nutzers bewerten, wobei der nicht vertrauenswürdige Zwischenkontext isoliert wird.
Was braucht es über ein Modell hinaus, das die Evals besteht?
Ein Prototyp, der die Evals besteht, ist eine Zutat. Es braucht außerdem Golden Datasets aus realen Fehlern, Traces, CI-Gates, Canary, Rollback und Runbooks: diese werden engineered, nicht vorausgesetzt.
Fallnotizen
Vom Problem zum Ergebnis — anonymisiert.
Das selbstsichere, aber falsche Zitat
Problem Ein Dokumentenassistent antwortete mit autoritärem Ton und zitierte dabei den falschen Vertrag: in der Demo funktionierte es, vor Kunden brach das Vertrauen zusammen, weil niemand die Quelle zurückverfolgen konnte.
Methode Die reine Vektorsuche durch hybrides Retrieval (Vektoren + BM25), fusioniert über Reciprocal Rank Fusion, und Cross-Encoder-Reranking ersetzt, Chunk-zu-Quelle-Lineage und ein Treuemaß auf gesampelten Antworten hinzugefügt.
Ergebnis Jede Ausgabe lässt sich nun zum Dokument, Chunk und zur Policy-Version zurückverfolgen, die sie begründen; irrelevante Antworten werden vor dem Nutzer abgefangen, statt als Beschwerde aufzutauchen.
Der von einem Dokument gekaperte Agent
Problem Ein tool-nutzender Agent führte feindliche Anweisungen aus, die in hochgeladenen Dokumenten und Tool-Ausgaben versteckt waren: eine Prompt Injection, die in einer mandantenübergreifenden Umgebung eine Angriffsfläche öffnete.
Methode Defense in Depth eingeführt — Eingabe und abgerufenen Kontext vor dem Modell klassifizieren, die Ausgabe gegen Policy validieren, den nicht vertrauenswürdigen Zwischenkontext isolieren und Human-in-the-Loop bei wirkungsstarken Aktionen hinzufügen.
Ergebnis Das Verhalten des Agenten blieb auch bei feindlichen Eingaben vorhersehbar; jede Aktion wird gegen die ursprüngliche Absicht des Nutzers bewertet und Tool-Aufrufe werden protokolliert und sind nachvollziehbar.
Die Qualität, die still regredierte
Problem Dieselbe Eingabe lieferte unterschiedliche Ergebnisse und Verschlechterungen tauchten erst nach einer Nutzerbeschwerde auf, weil es weder Traces noch ein Regressionsdataset zum Abstützen gab.
Methode Ein Golden Dataset aus realen Fehlern aufgebaut, Grader an menschlichen Reviewern kalibriert, ein CI-Eval-Gate mit Canary und Rollback hinzugefügt und Traces gemäß OpenTelemetry GenAI instrumentiert.
Ergebnis Regressionen werden vor dem Release blockiert statt nach einer Beschwerde, und das Verhalten des Systems ist heute Run für Run reproduzierbar und untersuchbar.
Tiefer eintauchen
RAG-Wissensbasis, die nichts erfindet→
Die Retrieval-Schicht im Detail: Grounding auf den Quellen, nachvollziehbare Zitate, Kontrolle der Halluzinationen.
Governte KI-Adoption→
Wie man KI mit Audits, Rollen und Policy in Produktion bringt — nicht nur mit einem guten Prototyp.
Custom oder Plattform: Build-vs-Buy→
Wann jede Schicht maßgeschneidert zu bauen ist und wann über Plattform oder API zu komponieren.