Zum Inhalt springen

AI Products · Vertiefung

Architektur eines KI-Produkts in Produktion: von den Daten bis zu den Guardrails

Die sechs Schichten, die aus einem Prototyp ein verlässliches KI-Produkt machen: governte Ingestion, messbares Retrieval, deterministische Orchestrierung, Evals in der CI, durchgängige Guardrails und Kontrolle über Kosten und Latenz.

Software house — su misura, costruito da noi

KI-PRODUKT · PRODUKTIONSARCHITEKTUR

Rein · Rohe Anfrage + Quellen

Raus · Eine Antwort, die man ausliefern, nachvollziehen und der man vertrauen kann

01

Daten & Ingestion (Lineage, PII-Schwärzung)

Jedes Dokument kommt über strukturiertes Parsing, Sensibilitätsklassifikation und deterministische PII-Redaktion herein, bevor es das Modell erreicht, und jeder Chunk behält seine Verbindung zur Quelldatei, zur Policy-Version und zum erzeugenden Run: ohne diese Schicht übersteht keine Antwort ein Audit.

02

Retrieval (hybride Suche + Reranking)

Das Retrieval fusioniert semantische Vektorsuche und lexikalische BM25-Suche über Reciprocal Rank Fusion, dann ordnet ein Cross-Encoder-Reranker die Kandidaten neu, um die wirklich relevanten Passagen nach oben zu bringen: hier wird die Treue der Antwort gewonnen oder verloren.

03

Orchestrierung (begrenzter Agent, Tool-Calls)

Ein deterministischer Workflow entscheidet, wo du im Prozess stehst, während das Modell innerhalb einer begrenzten Menge von Aktionen wählt, was zu tun ist, mit Tool-Aufrufen über Standardprotokolle, dauerhafter Ausführung und Human-in-the-Loop bei wirkungsstarken Aktionen: der Agent bleibt auch unter Last vorhersehbar.

04

Evaluation & Observability (Evals in CI, Tracing)

Ein Golden Dataset aus realen Fehlern, an menschlichen Reviewern kalibrierte Grader und ein CI-Gate blockieren Regressionen vor dem Release, mit Traces, die offenen semantischen Konventionen (OpenTelemetry GenAI) folgen, um interoperabel und untersuchbar zu bleiben.

05

Guardrails & Sicherheit (Input/Output, Injection)

Guardrails validieren Eingabe, abgerufenen Kontext und Ausgabe durchgängig gegen Prompt Injection — die am häufigsten ausgenutzte Schwachstelle — indem sie den nicht vertrauenswürdigen Zwischenkontext klassifizieren und jede Aktion gegen die ursprüngliche Absicht des Nutzers bewerten.

06

Kosten & Latenz (Routing, Caching, TTFT)

Komplexitätsbasiertes Routing, semantisches Caching und Token-Budgets halten Kosten und Time-to-First-Token in Schach, mit Streaming für die wahrgenommene Latenz, sodass die Rechnung nicht explodiert und die Qualität nicht nachlässt, wenn der Traffic wächst.

Der Punkt

Die Demo überzeugt, das Produkt bricht zusammen

Ein KI-Prototyp funktioniert, weil er auf bekannten Eingaben läuft, single-tenant, ohne feindlichen Traffic. Produktion schreibt jede Regel neu.

  • Selbstsichere, aber falsche Antworten. Das Modell zitiert mit autoritärem Ton die falschen Dokumente: der Engpass ist das Retrieval, nicht die Generierung.
  • Nicht reproduzierbares Verhalten. Dieselbe Eingabe liefert unterschiedliche Ergebnisse und niemand weiß warum, weil es weder Traces noch ein Regressionsdataset gibt.
  • Kosten und Latenz außer Kontrolle. Wortreiche Prompts, kein Caching, kein Routing nach Komplexität: die Rechnung wächst und die Time-to-First-Token verschlechtert sich unter Last.
  • Eine offene Angriffsfläche. Feindliche Anweisungen, in einem Dokument oder einer Tool-Ausgabe versteckt, kapern den Agenten: Prompt Injection ist die am häufigsten ausgenutzte Schwachstelle.
  • Keine Nachvollziehbarkeit. Wenn ein Nutzer einen Fehler meldet, lässt sich nicht zum Quelldokument, zum Chunk und zum Run zurückverfolgen, die ihn erzeugt haben.

Für Teams, die eine KI vom Proof of Concept zu einem Produktionssystem führen, mit Audits, SLAs und Kostenobergrenzen.

Die sechs Schichten

Was aus einem Prototyp ein echtes Produkt macht

Ein KI-Produkt in Produktion ist ein verteiltes System, in dem das Modell nur der Planer ist. Sechs Schichten tragen es.

Daten und Ingestion

Dokumente kommen über strukturiertes Parsing, Sensibilitätsklassifikation und deterministische PII-Redaktion herein, bevor sie das Modell erreichen. Jede Ausgabe lässt sich zur Quelldatei, zur Policy-Version und zum erzeugenden Run zurückverfolgen.

Retrieval

Der Abruf kombiniert semantische Suche (Vektoren) und lexikalische Suche (BM25), fusioniert über Reciprocal Rank Fusion, dann ordnet ein Cross-Encoder-Reranker die Kandidaten neu. Hier wird die Treue der Antwort gewonnen oder verloren.

Orchestrierung und Agenten

Ein deterministischer Workflow entscheidet, wo du im Prozess stehst; das Modell entscheidet, was innerhalb einer begrenzten Menge von Aktionen zu tun ist. Tool-Aufrufe laufen über Standardprotokolle, mit dauerhafter Ausführung und Human-in-the-Loop bei wirkungsstarken Aktionen.

Evaluierung und Observability

Ein Golden Dataset aus realen Fehlern, an menschlichen Reviewern kalibrierte Grader und ein CI-Gate, das Regressionen vor dem Release blockiert. Traces folgen offenen semantischen Konventionen (OpenTelemetry GenAI), um interoperabel zu bleiben.

Guardrails und Kosten

Guardrails validieren Eingabe, abgerufenen Kontext und Ausgabe durchgängig gegen Prompt Injection; komplexitätsbasiertes Routing, semantisches Caching und Token-Budgets halten Kosten und Latenz in Schach, ohne die Qualität zu mindern.

Vom Datum zur Antwort

Die Reise einer einzelnen Anfrage

Was eine Anfrage durchläuft, wenn die Architektur vollständig ist, von der Datenschicht bis zur zurückgegebenen Antwort.

1
Governte Ingestion

Das Dokument wird geparst, nach Sensibilität klassifiziert, von PII bereinigt und mit Zweck-Tags indexiert; jeder Chunk behält seine Verbindung zur Quelle.

2
Retrieval und Rerank

Hybride Vektor- + Stichwortsuche, Rank-Fusion, dann Cross-Encoder-Reranking, um die wirklich relevanten Passagen nach oben zu bringen.

3
Begrenzte Orchestrierung

Der Orchestrator leitet die Anfrage weiter, ruft die nötigen Tools auf und hält den Agenten an kritischen Entscheidungspunkten an; jeder Aufruf wird protokolliert.

4
Guardrails, Eval und Rückgabe

Ausgabe gegen Policy und Injection-Signale validiert, auf gesampelten Traces evaluiert, dann mit Caching und Streaming für die wahrgenommene Latenz zurückgegeben.

Sechs Schichten pro Anfrage durchlaufen, jede messbar und unabhängig nachvollziehbar.

Prototyp vs. Produkt

Wo sich alles ändert

Gleiches Modell, andere Welt. Der Abstand liegt nicht im Prompt: er liegt in den Schichten darum herum.

DimensionPrototypProdukt in Produktion
DatenManuell hochgeladene DateienGovernte Ingestion, PII redigiert, nachvollziehbare Lineage
RetrievalNur VektorsucheHybrid + Reranking, Treue gemessen
SteuerungFrei agierender AgentDeterministischer Workflow, begrenzte Tools, Human-in-the-Loop
QualitätVon Hand getestetEvals in der CI auf einem Golden Dataset, Regressions-Gate
Sicherheit und KostenKeine GuardrailsDefense in Depth, Routing, Caching, Token-Budgets
Was du bekommst

Der Wert der sechs Schichten

Das ist keine Architekturtheorie: es ist das, was es dir erlaubt, vor einem Kunden oder einem Audit deinen Namen unter eine Antwort zu setzen.

01

Antworten, die ein Audit überstehen

Jede Ausgabe lässt sich zum Dokument, zum Chunk und zur Policy-Version zurückverfolgen: erklärbar, reproduzierbar, verteidigbar.

02

Zuverlässigkeit unter echtem Traffic

Deterministische Orchestrierung und durchgängige Guardrails halten das Verhalten vorhersehbar, auch bei feindlichen, mandantenübergreifenden Eingaben.

03

Qualität, die nicht regrediert

Evals in der CI blockieren Verschlechterungen vor dem Release, nicht nach einer Nutzerbeschwerde.

04

Governte Kosten und Latenz

Komplexitätsbasiertes Routing, semantisches Caching und Token-Budgets halten Rechnung und Time-to-First-Token im großen Maßstab unter Kontrolle.

In Produktion ist ein Agent kein Prompt: er ist ein verteiltes System, in dem das Modell der Planer ist.

Direkte Fragen

Was Kunden uns fragen

Warum ist die Antwort selbstsicher, aber falsch?

Fast immer liegt das Problem stromaufwärts: das Retrieval hat die falschen Dokumente hervorgebracht und das Modell hat eine wohlgeformte, aber auf der falschen Quelle gegründete Antwort erzeugt. Man behebt es mit hybridem Retrieval, Reranking und Treuemessung, nicht mit dem Prompt.

Wie verteidigen wir uns gegen Prompt Injection?

Mit Defense in Depth: Eingabe und abgerufenen Kontext vor dem Modell klassifizieren, die Ausgabe gegen Policy validieren und jede Agentenaktion gegen die ursprüngliche Absicht des Nutzers bewerten, wobei der nicht vertrauenswürdige Zwischenkontext isoliert wird.

Was braucht es über ein Modell hinaus, das die Evals besteht?

Ein Prototyp, der die Evals besteht, ist eine Zutat. Es braucht außerdem Golden Datasets aus realen Fehlern, Traces, CI-Gates, Canary, Rollback und Runbooks: diese werden engineered, nicht vorausgesetzt.

Fallnotizen

Vom Problem zum Ergebnis — anonymisiert.

Rechtsdienstleistungen · anonymisiert

Das selbstsichere, aber falsche Zitat

Problem Ein Dokumentenassistent antwortete mit autoritärem Ton und zitierte dabei den falschen Vertrag: in der Demo funktionierte es, vor Kunden brach das Vertrauen zusammen, weil niemand die Quelle zurückverfolgen konnte.

Methode Die reine Vektorsuche durch hybrides Retrieval (Vektoren + BM25), fusioniert über Reciprocal Rank Fusion, und Cross-Encoder-Reranking ersetzt, Chunk-zu-Quelle-Lineage und ein Treuemaß auf gesampelten Antworten hinzugefügt.

Ergebnis Jede Ausgabe lässt sich nun zum Dokument, Chunk und zur Policy-Version zurückverfolgen, die sie begründen; irrelevante Antworten werden vor dem Nutzer abgefangen, statt als Beschwerde aufzutauchen.

Finanzdienstleistungen · anonymisiert

Der von einem Dokument gekaperte Agent

Problem Ein tool-nutzender Agent führte feindliche Anweisungen aus, die in hochgeladenen Dokumenten und Tool-Ausgaben versteckt waren: eine Prompt Injection, die in einer mandantenübergreifenden Umgebung eine Angriffsfläche öffnete.

Methode Defense in Depth eingeführt — Eingabe und abgerufenen Kontext vor dem Modell klassifizieren, die Ausgabe gegen Policy validieren, den nicht vertrauenswürdigen Zwischenkontext isolieren und Human-in-the-Loop bei wirkungsstarken Aktionen hinzufügen.

Ergebnis Das Verhalten des Agenten blieb auch bei feindlichen Eingaben vorhersehbar; jede Aktion wird gegen die ursprüngliche Absicht des Nutzers bewertet und Tool-Aufrufe werden protokolliert und sind nachvollziehbar.

Gesundheitswesen · anonymisiert

Die Qualität, die still regredierte

Problem Dieselbe Eingabe lieferte unterschiedliche Ergebnisse und Verschlechterungen tauchten erst nach einer Nutzerbeschwerde auf, weil es weder Traces noch ein Regressionsdataset zum Abstützen gab.

Methode Ein Golden Dataset aus realen Fehlern aufgebaut, Grader an menschlichen Reviewern kalibriert, ein CI-Eval-Gate mit Canary und Rollback hinzugefügt und Traces gemäß OpenTelemetry GenAI instrumentiert.

Ergebnis Regressionen werden vor dem Release blockiert statt nach einer Beschwerde, und das Verhalten des Systems ist heute Run für Run reproduzierbar und untersuchbar.

Tiefer eintauchen

Bringen wir das in Ihren Stack.