Direct naar de inhoud

AI Products · Verdieping

Architectuur van een AI-product in productie: van data tot guardrails

De zes lagen die een prototype in een betrouwbaar AI-product veranderen: bestuurde ingestion, meetbare retrieval, deterministische orchestratie, evals in CI, end-to-end guardrails en controle over kosten en latentie.

Software house — su misura, costruito da noi

AI-PRODUCT · PRODUCTIEARCHITECTUUR

Erin · Ruwe aanvraag + bronnen

Eruit · Een antwoord dat je kunt leveren, traceren en vertrouwen

01

Data & ingestie (lineage, PII-redactie)

Elk document komt binnen via gestructureerde parsing, gevoeligheidsclassificatie en deterministische PII-redactie voordat het het model bereikt, en elke chunk behoudt zijn link met het bronbestand, de policyversie en de run die het produceerde: zonder deze laag doorstaat geen enkel antwoord een audit.

02

Retrieval (hybride zoeken + reranking)

De retrieval voegt semantische vectorzoekopdracht en lexicale BM25-zoekopdracht samen via Reciprocal Rank Fusion, waarna een cross-encoder-reranker de kandidaten herordent om de werkelijk relevante passages naar boven te halen: hier wordt de getrouwheid van het antwoord gewonnen of verloren.

03

Orkestratie (begrensde agent, tool-calls)

Een deterministische workflow bepaalt waar je in het proces bent terwijl het model kiest wat te doen binnen een begrensde set acties, met toolaanroepen via standaardprotocollen, duurzame uitvoering en human-in-the-loop bij acties met grote impact: de agent blijft voorspelbaar, zelfs onder belasting.

04

Evaluatie & observability (evals in CI, tracing)

Een golden dataset gebouwd uit echte fouten, graders gekalibreerd tegen menselijke reviewers en een CI-gate blokkeren regressies vóór de release, met traces die open semantische conventies (OpenTelemetry GenAI) volgen om interoperabel en onderzoekbaar te blijven.

05

Guardrails & security (input/output, injectie)

Guardrails valideren input, opgehaalde context en output end-to-end tegen prompt injection — de meest misbruikte kwetsbaarheid — door de niet-vertrouwde tussencontext te classificeren en elke actie te evalueren tegen de oorspronkelijke intentie van de gebruiker.

06

Kosten & latentie (routing, caching, TTFT)

Complexiteitsgebaseerde routing, semantische caching en tokenbudgetten houden kosten en time-to-first-token in toom, met streaming voor de waargenomen latentie, zodat de rekening niet explodeert en de kwaliteit niet verslechtert naarmate het verkeer groeit.

De kern

De demo overtuigt, het product stort in

Een AI-prototype werkt omdat het op bekende inputs draait, single-tenant, zonder vijandig verkeer. Productie herschrijft elke regel.

  • Zelfverzekerde maar foute antwoorden. Het model citeert met gezaghebbende toon de verkeerde documenten: de bottleneck is de retrieval, niet de generatie.
  • Niet-reproduceerbaar gedrag. Dezelfde input levert verschillende uitkomsten en niemand weet waarom, omdat er geen traces en geen regressiedataset zijn.
  • Kosten en latentie uit de hand. Wijdlopige prompts, geen caching, geen routing naar complexiteit: de rekening groeit en de time-to-first-token verslechtert onder belasting.
  • Een open aanvalsoppervlak. Vijandige instructies verborgen in een document of een tooluitvoer kapen de agent: prompt injection is de meest misbruikte kwetsbaarheid.
  • Geen traceerbaarheid. Wanneer een gebruiker een fout meldt, kun je niet terugtraceren naar het brondocument, de chunk en de run die het hebben geproduceerd.

Voor teams die een AI van proof-of-concept naar een productiesysteem brengen, met audits, SLA's en kostenplafonds.

De zes lagen

Wat een prototype tot een echt product maakt

Een AI-product in productie is een gedistribueerd systeem waarin het model slechts de planner is. Zes lagen dragen het.

Data en ingestion

Documenten komen binnen via gestructureerde parsing, gevoeligheidsclassificatie en deterministische PII-redactie voordat ze het model bereiken. Elke uitvoer is herleidbaar tot het bronbestand, de policyversie en de run die haar produceerde.

Retrieval

Het ophalen combineert semantische zoekopdracht (vectoren) en lexicale zoekopdracht (BM25), samengevoegd via Reciprocal Rank Fusion, waarna een cross-encoder-reranker de kandidaten herordent. Hier wordt de getrouwheid van het antwoord gewonnen of verloren.

Orchestratie en agenten

Een deterministische workflow bepaalt waar je in het proces bent; het model bepaalt wat te doen binnen een begrensde set acties. Toolaanroepen lopen via standaardprotocollen, met duurzame uitvoering en human-in-the-loop bij acties met grote impact.

Evaluatie en observability

Een golden dataset gebouwd uit echte fouten, graders gekalibreerd tegen menselijke reviewers, en een CI-gate die regressies blokkeert vóór de release. Traces volgen open semantische conventies (OpenTelemetry GenAI) om interoperabel te blijven.

Guardrails en kosten

Guardrails valideren input, opgehaalde context en output end-to-end tegen prompt injection; complexiteitsgebaseerde routing, semantische caching en tokenbudgetten houden kosten en latentie in toom zonder de kwaliteit te schaden.

Van data naar antwoord

De reis van één enkel verzoek

Wat een verzoek doorkruist wanneer de architectuur compleet is, van de datalaag tot het teruggegeven antwoord.

1
Bestuurde ingestion

Het document wordt geparseerd, op gevoeligheid geclassificeerd, van PII ontdaan en geïndexeerd met doel-tags; elke chunk behoudt zijn link met de bron.

2
Retrieval en rerank

Hybride vector- + trefwoordzoekopdracht, rankfusie, daarna cross-encoder-reranking om de werkelijk relevante passages naar boven te halen.

3
Begrensde orchestratie

De orchestrator routeert het verzoek, roept de benodigde tools aan en pauzeert de agent op kritieke beslispunten; elke aanroep wordt gelogd.

4
Guardrails, eval en teruggave

Output gevalideerd tegen policy en injectiesignalen, geëvalueerd op bemonsterde traces, daarna teruggegeven met caching en streaming voor de waargenomen latentie.

Zes lagen per verzoek doorkruist, elk meetbaar en onafhankelijk traceerbaar.

Prototype vs product

Waar alles verandert

Zelfde model, andere wereld. De kloof zit niet in de prompt: hij zit in de lagen eromheen.

DimensiePrototypeProduct in productie
DataHandmatig geüploade bestandenBestuurde ingestion, PII geredigeerd, traceerbare lineage
RetrievalAlleen vectorzoekopdrachtHybride + reranking, getrouwheid gemeten
ControleVrij rondzwervende agentDeterministische workflow, begrensde tools, human-in-the-loop
KwaliteitHandmatig getestEvals in CI op een golden dataset, regressiegate
Beveiliging en kostenGeen guardrailsDefense in depth, routing, caching, tokenbudgetten
Wat je krijgt

De waarde van de zes lagen

Dit is geen architectuurtheorie: het is wat je in staat stelt je naam onder een antwoord te zetten voor een klant of een audit.

01

Antwoorden die een audit doorstaan

Elke uitvoer is herleidbaar tot het document, de chunk en de policyversie: uitlegbaar, reproduceerbaar, verdedigbaar.

02

Betrouwbaarheid onder echt verkeer

Deterministische orchestratie en end-to-end guardrails houden het gedrag voorspelbaar, zelfs bij vijandige, multi-tenant inputs.

03

Kwaliteit die niet terugvalt

Evals in CI blokkeren verslechteringen vóór de release, niet na een klacht van een gebruiker.

04

Bestuurde kosten en latentie

Complexiteitsgebaseerde routing, semantische caching en tokenbudgetten houden de rekening en de time-to-first-token op schaal onder controle.

In productie is een agent geen prompt: het is een gedistribueerd systeem waarin het model de planner is.

Directe vragen

Wat klanten ons vragen

Waarom is het antwoord zelfverzekerd maar fout?

Bijna altijd zit het probleem stroomopwaarts: de retrieval haalde de verkeerde documenten op en het model produceerde een welgevormd antwoord dat gegrond was in de verkeerde bron. Je lost het op met hybride retrieval, reranking en getrouwheidsmeting, niet met de prompt.

Hoe verdedigen we ons tegen prompt injection?

Met defense in depth: input en opgehaalde context classificeren vóór het model, output valideren tegen policy, en elke agentactie evalueren tegen de oorspronkelijke intentie van de gebruiker, waarbij de niet-vertrouwde tussencontext wordt geïsoleerd.

Wat is er nodig naast een model dat de evals haalt?

Een prototype dat de evals haalt is één ingrediënt. Je hebt ook golden datasets uit echte fouten nodig, traces, CI-gates, canary, rollback en runbooks: die worden ge-engineerd, niet verondersteld.

Cases

Van probleem naar resultaat — geanonimiseerd.

Juridische diensten · geanonimiseerd

De zelfverzekerde maar foute citatie

Probleem Een documentassistent antwoordde met gezaghebbende toon terwijl hij het verkeerde contract citeerde: in de demo werkte het, voor klanten stortte het vertrouwen in omdat niemand de bron kon terugtraceren.

Methode De alleen-vectorzoekopdracht vervangen door hybride retrieval (vectoren + BM25) samengevoegd via Reciprocal Rank Fusion en cross-encoder-reranking, chunk-naar-bron-lineage toegevoegd en een getrouwheidsmaat op bemonsterde antwoorden.

Resultaat Elke uitvoer is nu herleidbaar tot het document, de chunk en de policyversie die haar gronden; irrelevante antwoorden worden vóór de gebruiker onderschept in plaats van als klacht op te duiken.

Financiële diensten · geanonimiseerd

De agent gekaapt door een document

Probleem Een tool-gebruikende agent voerde vijandige instructies uit die verborgen waren in geüploade documenten en tooluitvoer: een prompt injection die een aanvalsoppervlak opende in een multi-tenant-omgeving.

Methode Defense in depth ingevoerd — input en opgehaalde context classificeren vóór het model, output valideren tegen policy, niet-vertrouwde tussencontext isoleren en human-in-the-loop toevoegen bij acties met grote impact.

Resultaat Het gedrag van de agent bleef voorspelbaar, zelfs bij vijandige inputs; elke actie wordt geëvalueerd tegen de oorspronkelijke intentie van de gebruiker en toolaanroepen worden gelogd en zijn traceerbaar.

Gezondheidszorg · geanonimiseerd

De kwaliteit die in stilte terugviel

Probleem Dezelfde input leverde verschillende uitkomsten en verslechteringen kwamen pas na een klacht van een gebruiker boven, omdat er geen traces en geen regressiedataset waren om op te steunen.

Methode Een golden dataset gebouwd uit echte fouten, graders gekalibreerd tegen menselijke reviewers, een CI-eval-gate met canary en rollback toegevoegd, en traces geïnstrumenteerd conform OpenTelemetry GenAI.

Resultaat Regressies worden vóór de release geblokkeerd in plaats van na een klacht, en het gedrag van het systeem is nu reproduceerbaar en onderzoekbaar run voor run.

Verdiep verder

Breng dit naar jouw stack.