AI Products · Verdieping
Architectuur van een AI-product in productie: van data tot guardrails
De zes lagen die een prototype in een betrouwbaar AI-product veranderen: bestuurde ingestion, meetbare retrieval, deterministische orchestratie, evals in CI, end-to-end guardrails en controle over kosten en latentie.
AI-PRODUCT · PRODUCTIEARCHITECTUUR
Erin · Ruwe aanvraag + bronnen
Eruit · Een antwoord dat je kunt leveren, traceren en vertrouwen
Data & ingestie (lineage, PII-redactie)
Elk document komt binnen via gestructureerde parsing, gevoeligheidsclassificatie en deterministische PII-redactie voordat het het model bereikt, en elke chunk behoudt zijn link met het bronbestand, de policyversie en de run die het produceerde: zonder deze laag doorstaat geen enkel antwoord een audit.
Retrieval (hybride zoeken + reranking)
De retrieval voegt semantische vectorzoekopdracht en lexicale BM25-zoekopdracht samen via Reciprocal Rank Fusion, waarna een cross-encoder-reranker de kandidaten herordent om de werkelijk relevante passages naar boven te halen: hier wordt de getrouwheid van het antwoord gewonnen of verloren.
Orkestratie (begrensde agent, tool-calls)
Een deterministische workflow bepaalt waar je in het proces bent terwijl het model kiest wat te doen binnen een begrensde set acties, met toolaanroepen via standaardprotocollen, duurzame uitvoering en human-in-the-loop bij acties met grote impact: de agent blijft voorspelbaar, zelfs onder belasting.
Evaluatie & observability (evals in CI, tracing)
Een golden dataset gebouwd uit echte fouten, graders gekalibreerd tegen menselijke reviewers en een CI-gate blokkeren regressies vóór de release, met traces die open semantische conventies (OpenTelemetry GenAI) volgen om interoperabel en onderzoekbaar te blijven.
Guardrails & security (input/output, injectie)
Guardrails valideren input, opgehaalde context en output end-to-end tegen prompt injection — de meest misbruikte kwetsbaarheid — door de niet-vertrouwde tussencontext te classificeren en elke actie te evalueren tegen de oorspronkelijke intentie van de gebruiker.
Kosten & latentie (routing, caching, TTFT)
Complexiteitsgebaseerde routing, semantische caching en tokenbudgetten houden kosten en time-to-first-token in toom, met streaming voor de waargenomen latentie, zodat de rekening niet explodeert en de kwaliteit niet verslechtert naarmate het verkeer groeit.
De demo overtuigt, het product stort in
Een AI-prototype werkt omdat het op bekende inputs draait, single-tenant, zonder vijandig verkeer. Productie herschrijft elke regel.
- Zelfverzekerde maar foute antwoorden. Het model citeert met gezaghebbende toon de verkeerde documenten: de bottleneck is de retrieval, niet de generatie.
- Niet-reproduceerbaar gedrag. Dezelfde input levert verschillende uitkomsten en niemand weet waarom, omdat er geen traces en geen regressiedataset zijn.
- Kosten en latentie uit de hand. Wijdlopige prompts, geen caching, geen routing naar complexiteit: de rekening groeit en de time-to-first-token verslechtert onder belasting.
- Een open aanvalsoppervlak. Vijandige instructies verborgen in een document of een tooluitvoer kapen de agent: prompt injection is de meest misbruikte kwetsbaarheid.
- Geen traceerbaarheid. Wanneer een gebruiker een fout meldt, kun je niet terugtraceren naar het brondocument, de chunk en de run die het hebben geproduceerd.
Voor teams die een AI van proof-of-concept naar een productiesysteem brengen, met audits, SLA's en kostenplafonds.
Wat een prototype tot een echt product maakt
Een AI-product in productie is een gedistribueerd systeem waarin het model slechts de planner is. Zes lagen dragen het.
Data en ingestion
Documenten komen binnen via gestructureerde parsing, gevoeligheidsclassificatie en deterministische PII-redactie voordat ze het model bereiken. Elke uitvoer is herleidbaar tot het bronbestand, de policyversie en de run die haar produceerde.
Retrieval
Het ophalen combineert semantische zoekopdracht (vectoren) en lexicale zoekopdracht (BM25), samengevoegd via Reciprocal Rank Fusion, waarna een cross-encoder-reranker de kandidaten herordent. Hier wordt de getrouwheid van het antwoord gewonnen of verloren.
Orchestratie en agenten
Een deterministische workflow bepaalt waar je in het proces bent; het model bepaalt wat te doen binnen een begrensde set acties. Toolaanroepen lopen via standaardprotocollen, met duurzame uitvoering en human-in-the-loop bij acties met grote impact.
Evaluatie en observability
Een golden dataset gebouwd uit echte fouten, graders gekalibreerd tegen menselijke reviewers, en een CI-gate die regressies blokkeert vóór de release. Traces volgen open semantische conventies (OpenTelemetry GenAI) om interoperabel te blijven.
Guardrails en kosten
Guardrails valideren input, opgehaalde context en output end-to-end tegen prompt injection; complexiteitsgebaseerde routing, semantische caching en tokenbudgetten houden kosten en latentie in toom zonder de kwaliteit te schaden.
De reis van één enkel verzoek
Wat een verzoek doorkruist wanneer de architectuur compleet is, van de datalaag tot het teruggegeven antwoord.
Het document wordt geparseerd, op gevoeligheid geclassificeerd, van PII ontdaan en geïndexeerd met doel-tags; elke chunk behoudt zijn link met de bron.
Hybride vector- + trefwoordzoekopdracht, rankfusie, daarna cross-encoder-reranking om de werkelijk relevante passages naar boven te halen.
De orchestrator routeert het verzoek, roept de benodigde tools aan en pauzeert de agent op kritieke beslispunten; elke aanroep wordt gelogd.
Output gevalideerd tegen policy en injectiesignalen, geëvalueerd op bemonsterde traces, daarna teruggegeven met caching en streaming voor de waargenomen latentie.
Zes lagen per verzoek doorkruist, elk meetbaar en onafhankelijk traceerbaar.
Waar alles verandert
Zelfde model, andere wereld. De kloof zit niet in de prompt: hij zit in de lagen eromheen.
| Dimensie | Prototype | Product in productie |
|---|---|---|
| Data | Handmatig geüploade bestanden | Bestuurde ingestion, PII geredigeerd, traceerbare lineage |
| Retrieval | Alleen vectorzoekopdracht | Hybride + reranking, getrouwheid gemeten |
| Controle | Vrij rondzwervende agent | Deterministische workflow, begrensde tools, human-in-the-loop |
| Kwaliteit | Handmatig getest | Evals in CI op een golden dataset, regressiegate |
| Beveiliging en kosten | Geen guardrails | Defense in depth, routing, caching, tokenbudgetten |
De waarde van de zes lagen
Dit is geen architectuurtheorie: het is wat je in staat stelt je naam onder een antwoord te zetten voor een klant of een audit.
Antwoorden die een audit doorstaan
Elke uitvoer is herleidbaar tot het document, de chunk en de policyversie: uitlegbaar, reproduceerbaar, verdedigbaar.
Betrouwbaarheid onder echt verkeer
Deterministische orchestratie en end-to-end guardrails houden het gedrag voorspelbaar, zelfs bij vijandige, multi-tenant inputs.
Kwaliteit die niet terugvalt
Evals in CI blokkeren verslechteringen vóór de release, niet na een klacht van een gebruiker.
Bestuurde kosten en latentie
Complexiteitsgebaseerde routing, semantische caching en tokenbudgetten houden de rekening en de time-to-first-token op schaal onder controle.
In productie is een agent geen prompt: het is een gedistribueerd systeem waarin het model de planner is.
Wat klanten ons vragen
Waarom is het antwoord zelfverzekerd maar fout?
Bijna altijd zit het probleem stroomopwaarts: de retrieval haalde de verkeerde documenten op en het model produceerde een welgevormd antwoord dat gegrond was in de verkeerde bron. Je lost het op met hybride retrieval, reranking en getrouwheidsmeting, niet met de prompt.
Hoe verdedigen we ons tegen prompt injection?
Met defense in depth: input en opgehaalde context classificeren vóór het model, output valideren tegen policy, en elke agentactie evalueren tegen de oorspronkelijke intentie van de gebruiker, waarbij de niet-vertrouwde tussencontext wordt geïsoleerd.
Wat is er nodig naast een model dat de evals haalt?
Een prototype dat de evals haalt is één ingrediënt. Je hebt ook golden datasets uit echte fouten nodig, traces, CI-gates, canary, rollback en runbooks: die worden ge-engineerd, niet verondersteld.
Cases
Van probleem naar resultaat — geanonimiseerd.
De zelfverzekerde maar foute citatie
Probleem Een documentassistent antwoordde met gezaghebbende toon terwijl hij het verkeerde contract citeerde: in de demo werkte het, voor klanten stortte het vertrouwen in omdat niemand de bron kon terugtraceren.
Methode De alleen-vectorzoekopdracht vervangen door hybride retrieval (vectoren + BM25) samengevoegd via Reciprocal Rank Fusion en cross-encoder-reranking, chunk-naar-bron-lineage toegevoegd en een getrouwheidsmaat op bemonsterde antwoorden.
Resultaat Elke uitvoer is nu herleidbaar tot het document, de chunk en de policyversie die haar gronden; irrelevante antwoorden worden vóór de gebruiker onderschept in plaats van als klacht op te duiken.
De agent gekaapt door een document
Probleem Een tool-gebruikende agent voerde vijandige instructies uit die verborgen waren in geüploade documenten en tooluitvoer: een prompt injection die een aanvalsoppervlak opende in een multi-tenant-omgeving.
Methode Defense in depth ingevoerd — input en opgehaalde context classificeren vóór het model, output valideren tegen policy, niet-vertrouwde tussencontext isoleren en human-in-the-loop toevoegen bij acties met grote impact.
Resultaat Het gedrag van de agent bleef voorspelbaar, zelfs bij vijandige inputs; elke actie wordt geëvalueerd tegen de oorspronkelijke intentie van de gebruiker en toolaanroepen worden gelogd en zijn traceerbaar.
De kwaliteit die in stilte terugviel
Probleem Dezelfde input leverde verschillende uitkomsten en verslechteringen kwamen pas na een klacht van een gebruiker boven, omdat er geen traces en geen regressiedataset waren om op te steunen.
Methode Een golden dataset gebouwd uit echte fouten, graders gekalibreerd tegen menselijke reviewers, een CI-eval-gate met canary en rollback toegevoegd, en traces geïnstrumenteerd conform OpenTelemetry GenAI.
Resultaat Regressies worden vóór de release geblokkeerd in plaats van na een klacht, en het gedrag van het systeem is nu reproduceerbaar en onderzoekbaar run voor run.
Verdiep verder
RAG-kennisbank die niets verzint→
De retrievallaag in detail: grounding op de bronnen, traceerbare citaties, controle over hallucinaties.
Bestuurde AI-adoptie→
Hoe je AI naar productie brengt met audits, rollen en policy — niet alleen met een goed prototype.
Op maat of platform: build-vs-buy→
Wanneer elke laag op maat te bouwen en wanneer te componeren via platform of API.