Przejdź do treści

AI Products · Pogłębienie

Architektura produktu AI w produkcji: od danych po guardraile

Sześć warstw, które zmieniają prototyp w niezawodny produkt AI: zarządzana ingestia, mierzalny retrieval, deterministyczna orkiestracja, ewaluacje w CI, guardraile end-to-end oraz kontrola kosztów i opóźnień.

Software house — su misura, costruito da noi

PRODUKT AI · ARCHITEKTURA PRODUKCYJNA

Wejście · Surowe zapytanie + źródła

Wyjście · Odpowiedź, którą możesz wdrożyć, prześledzić i której możesz zaufać

01

Dane i ingestia (lineage, redakcja PII)

Każdy dokument wchodzi przez ustrukturyzowany parsing, klasyfikację wrażliwości i deterministyczną redakcję PII, zanim dotrze do modelu, a każdy chunk zachowuje powiązanie z plikiem źródłowym, wersją polityki i runem, który go wyprodukował: bez tej warstwy żadna odpowiedź nie przetrwa audytu.

02

Wyszukiwanie (hybrydowe + reranking)

Retrieval scala semantyczne wyszukiwanie wektorowe i leksykalne wyszukiwanie BM25 przez Reciprocal Rank Fusion, a następnie reranker cross-encoder przegrupowuje kandydatów, by wynieść na górę naprawdę istotne fragmenty: to tutaj wygrywa się lub przegrywa wierność odpowiedzi.

03

Orkiestracja (agent z ograniczeniami, wywołania narzędzi)

Deterministyczny workflow decyduje, gdzie jesteś w procesie, podczas gdy model wybiera, co zrobić w ramach ograniczonego zbioru akcji, z wywołaniami narzędzi po standardowych protokołach, trwałym wykonaniem i human-in-the-loop przy akcjach o dużym wpływie: agent pozostaje przewidywalny nawet pod obciążeniem.

04

Ewaluacja i obserwowalność (evale w CI, tracing)

Złoty zbiór zbudowany z realnych awarii, oceniacze skalibrowane względem ludzkich recenzentów i bramka w CI blokują regresje przed wydaniem, ze śladami podążającymi za otwartymi konwencjami semantycznymi (OpenTelemetry GenAI), by pozostać interoperacyjne i badalne.

05

Bariery ochronne i bezpieczeństwo (wejście/wyjście, injection)

Guardraile walidują wejście, odzyskany kontekst i wyjście end-to-end przeciw prompt injection — najczęściej wykorzystywanej podatności — klasyfikując niezaufany kontekst pośredni i oceniając każdą akcję względem pierwotnej intencji użytkownika.

06

Koszt i opóźnienia (routing, cache, TTFT)

Routing według złożoności, cache semantyczny i budżety tokenów trzymają w ryzach koszt i time-to-first-token, ze streamingiem dla postrzeganego opóźnienia, tak że rachunek nie eksploduje, a jakość nie spada, gdy ruch rośnie.

Sedno

Demo przekonuje, produkt się rozsypuje

Prototyp AI działa, bo działa na znanych wejściach, w single-tenant, bez wrogiego ruchu. Produkcja przepisuje wszystkie reguły.

  • Pewne, ale błędne odpowiedzi. Model autorytatywnym tonem cytuje niewłaściwe dokumenty: wąskim gardłem jest retrieval, nie generacja.
  • Niereprodukowalne zachowanie. To samo wejście daje różne wyniki i nikt nie wie dlaczego, bo nie ma ani śladów (traces), ani zbioru regresyjnego.
  • Koszty i opóźnienia poza kontrolą. Rozwlekłe prompty, brak cache'owania, brak routingu według złożoności: rachunek rośnie, a time-to-first-token pogarsza się pod obciążeniem.
  • Otwarta powierzchnia ataku. Wrogie instrukcje ukryte w dokumencie lub w wyjściu narzędzia przejmują agenta: prompt injection to najczęściej wykorzystywana podatność.
  • Brak śledzalności. Gdy użytkownik zgłasza błąd, nie da się dotrzeć do dokumentu źródłowego, chunka i runu, które go wyprodukowały.

Dla zespołów przeprowadzających AI z proof-of-concept do systemu produkcyjnego, z audytami, SLA i pułapami kosztów.

Sześć warstw

Co czyni z prototypu prawdziwy produkt

Produkt AI w produkcji to system rozproszony, w którym model jest tylko planistą. Trzymają go sześć warstwy.

Dane i ingestia

Dokumenty wchodzą przez ustrukturyzowany parsing, klasyfikację wrażliwości i deterministyczną redakcję PII, zanim dotrą do modelu. Każde wyjście da się prześledzić do pliku źródłowego, wersji polityki i runu, który je wyprodukował.

Retrieval

Odzyskiwanie łączy wyszukiwanie semantyczne (wektory) i leksykalne (BM25), scalone przez Reciprocal Rank Fusion, a następnie reranker cross-encoder przegrupowuje kandydatów. To tutaj wygrywa się lub przegrywa wierność odpowiedzi.

Orkiestracja i agenci

Deterministyczny workflow decyduje, gdzie jesteś w procesie; model decyduje, co zrobić w ramach ograniczonego zbioru akcji. Wywołania narzędzi przebiegają po standardowych protokołach, z trwałym wykonaniem i human-in-the-loop przy akcjach o dużym wpływie.

Ewaluacja i obserwowalność

Złoty zbiór (golden dataset) zbudowany z realnych awarii, oceniacze skalibrowane względem ludzkich recenzentów oraz bramka w CI blokująca regresje przed wydaniem. Ślady (traces) podążają za otwartymi konwencjami semantycznymi (OpenTelemetry GenAI), by pozostać interoperacyjne.

Guardraile i koszty

Guardraile walidują wejście, odzyskany kontekst i wyjście end-to-end przeciw prompt injection; routing według złożoności, cache semantyczny i budżety tokenów trzymają w ryzach koszt i opóźnienie bez pogarszania jakości.

Od danej do odpowiedzi

Droga pojedynczego żądania

Co przechodzi żądanie, gdy architektura jest kompletna, od warstwy danych po zwróconą odpowiedź.

1
Zarządzana ingestia

Dokument jest parsowany, klasyfikowany według wrażliwości, oczyszczany z PII i indeksowany z tagami celu; każdy chunk zachowuje powiązanie ze źródłem.

2
Retrieval i rerank

Hybrydowe wyszukiwanie wektor + słowo kluczowe, fuzja rankingów, a następnie reranking cross-encoder, by wynieść na górę naprawdę istotne fragmenty.

3
Ograniczona orkiestracja

Orkiestrator kieruje żądanie, wywołuje potrzebne narzędzia i wstrzymuje agenta w krytycznych punktach decyzyjnych; każde wywołanie jest logowane.

4
Guardraile, ewaluacja i zwrot

Wyjście zwalidowane względem polityki i sygnałów iniekcji, ocenione na próbkowanych śladach, a następnie zwrócone z cache i streamingiem dla postrzeganego opóźnienia.

Sześć warstw przekraczanych na żądanie, każda mierzalna i śledzalna niezależnie.

Prototyp vs produkt

Gdzie wszystko się zmienia

Ten sam model, inny świat. Dystans nie tkwi w prompcie: tkwi w warstwach wokół niego.

WymiarPrototypProdukt w produkcji
DanePliki wgrywane ręcznieZarządzana ingestia, PII zredagowane, śledzalny lineage
RetrievalTylko wyszukiwanie wektoroweHybrydowy + reranking, wierność zmierzona
KontrolaAgent bez ograniczeńDeterministyczny workflow, ograniczone narzędzia, human-in-the-loop
JakośćTestowana ręcznieEwaluacje w CI na złotym zbiorze, bramka regresji
Bezpieczeństwo i kosztyBrak guardrailiObrona w głąb, routing, cache, budżety tokenów
Co otrzymujesz

Wartość sześciu warstw

To nie teoria architektury: to coś, co pozwala podpisać się pod odpowiedzią przed klientem lub audytem.

01

Odpowiedzi, które przetrwają audyt

Każde wyjście da się prześledzić do dokumentu, chunka i wersji polityki: wyjaśnialne, reprodukowalne, obronne.

02

Niezawodność pod realnym ruchem

Deterministyczna orkiestracja i guardraile end-to-end utrzymują zachowanie przewidywalnym nawet przy wrogich, wielodzierżawnych wejściach.

03

Jakość, która nie regresuje

Ewaluacje w CI blokują pogorszenia przed wydaniem, a nie po skardze użytkownika.

04

Zarządzane koszty i opóźnienia

Routing według złożoności, cache semantyczny i budżety tokenów trzymają rachunek i time-to-first-token pod kontrolą w skali.

W produkcji agent nie jest promptem: jest systemem rozproszonym, w którym model jest planistą.

Pytania wprost

O co pytają nas klienci

Dlaczego odpowiedź jest pewna, ale błędna?

Prawie zawsze problem jest powyżej: retrieval wydobył niewłaściwe dokumenty, a model wyprodukował dobrze sformułowaną odpowiedź opartą na błędnym źródle. Naprawia się to hybrydowym retrievalem, rerankingiem i pomiarem wierności, nie promptem.

Jak bronimy się przed prompt injection?

Obroną w głąb: klasyfikować wejście i odzyskany kontekst przed modelem, walidować wyjście względem polityki i oceniać każdą akcję agenta względem pierwotnej intencji użytkownika, izolując niezaufany kontekst pośredni.

Czego trzeba poza modelem, który zdaje ewaluacje?

Prototyp, który zdaje ewaluacje, to jeden składnik. Potrzebne są też złote zbiory z realnych awarii, ślady, bramki w CI, canary, rollback i runbooki: te się inżynieruje, nie zakłada z góry.

Przypadki

Od problemu do wyniku — anonimowo.

Usługi prawne · zanonimizowane

Pewny, ale błędny cytat

Problem Asystent dokumentowy odpowiadał autorytatywnym tonem, cytując niewłaściwą umowę: w demo działał, przed klientami zaufanie się waliło, bo nikt nie umiał dotrzeć do źródła.

Metoda Zastąpiono wyłącznie wektorowe wyszukiwanie hybrydowym retrievalem (wektory + BM25) scalonym przez Reciprocal Rank Fusion i rerankingiem cross-encoder, dodano lineage chunk-do-źródła i miarę wierności na próbkowanych odpowiedziach.

Wynik Każde wyjście da się teraz prześledzić do dokumentu, chunka i wersji polityki, które je gruntują; nieistotne odpowiedzi są przechwytywane przed użytkownikiem, zamiast wypływać jako reklamacja.

Usługi finansowe · zanonimizowane

Agent przejęty przez dokument

Problem Agent korzystający z narzędzi wykonywał wrogie instrukcje ukryte wewnątrz wgranych dokumentów i wyjść narzędzi: prompt injection, który otwierał powierzchnię ataku w środowisku wielodzierżawnym.

Metoda Wprowadzono obronę w głąb — klasyfikację wejścia i odzyskanego kontekstu przed modelem, walidację wyjścia względem polityki, izolację niezaufanego kontekstu pośredniego i dodanie human-in-the-loop przy akcjach o dużym wpływie.

Wynik Zachowanie agenta pozostało przewidywalne nawet przy wrogich wejściach; każda akcja jest oceniana względem pierwotnej intencji użytkownika, a wywołania narzędzi są logowane i śledzalne.

Ochrona zdrowia · zanonimizowane

Jakość, która regresowała po cichu

Problem To samo wejście dawało różne wyniki, a pogorszenia wypływały dopiero po skardze użytkownika, bo nie było ani śladów, ani zbioru regresyjnego, na którym można się oprzeć.

Metoda Zbudowano złoty zbiór z realnych awarii, skalibrowano oceniacze względem ludzkich recenzentów, dodano bramkę ewaluacji w CI z canary i rollbackiem oraz oinstrumentowano ślady zgodne z OpenTelemetry GenAI.

Wynik Regresje są blokowane przed wydaniem, a nie po reklamacji, a zachowanie systemu jest dziś reprodukowalne i badalne run po runie.

Pogłęb dalej

Przenieśmy to do Twojego stacku.