Перейти до контенту

AI Products · Поглиблено

Архітектура продукту на базі ШІ в продакшені: від даних до guardrail-обмежень

Шість шарів, які перетворюють прототип на надійний ШІ-продукт: керований прийом даних, вимірюваний retrieval, детермінована оркестрація, оцінки в CI, наскрізні guardrail-обмеження та контроль витрат і затримки.

Software house — su misura, costruito da noi

AI-ПРОДУКТ · ПРОДАКШН-АРХІТЕКТУРА

Вхід · Сирий запит + джерела

Вихід · Відповідь, яку можна випустити, простежити і якій можна довіряти

01

Дані та завантаження (походження, видалення PII)

Кожен документ надходить через структурований парсинг, класифікацію чутливості та детерміновану редакцію PII, перш ніж досягти моделі, і кожен чанк зберігає зв'язок із вихідним файлом, версією політики та запуском, що його породив: без цього шару жодна відповідь не витримає аудит.

02

Пошук (гібридний пошук + переранжування)

Retrieval зливає семантичний векторний пошук і лексичний пошук BM25 через Reciprocal Rank Fusion, потім cross-encoder reranker переупорядковує кандидатів, щоб вивести нагору справді релевантні фрагменти: саме тут вірність відповіді виграється або програється.

03

Оркестрація (обмежений агент, виклики інструментів)

Детермінований робочий процес вирішує, де ви перебуваєте в процесі, поки модель обирає, що робити в межах обмеженого набору дій, з викликами інструментів стандартними протоколами, довговічним виконанням і human-in-the-loop на діях із високим впливом: агент залишається передбачуваним навіть під навантаженням.

04

Оцінювання та спостережність (evals у CI, трейсинг)

Золотий набір даних, побудований із реальних збоїв, оцінювачі, відкалібровані за людськими рецензентами, та шлюз у CI блокують регресії до релізу, з трейсами, що дотримуються відкритих семантичних угод (OpenTelemetry GenAI), щоб залишатися сумісними та досліджуваними.

05

Запобіжники та безпека (вхід/вихід, ін'єкції)

Guardrail-обмеження валідують вхід, видобутий контекст і вивід наскрізно проти prompt injection — найбільш експлуатованої вразливості — класифікуючи недовірений проміжний контекст і оцінюючи кожну дію відносно початкового наміру користувача.

06

Вартість і затримка (маршрутизація, кешування, TTFT)

Маршрутизація за складністю, семантичне кешування та бюджети токенів тримають під контролем витрати й time-to-first-token, з потоковою передачею для сприйманої затримки, так що рахунок не вибухає, а якість не погіршується зі зростанням трафіку.

Суть

Демо переконує, продукт руйнується

Прототип ШІ працює, тому що він працює на відомих входах, у single-tenant, без ворожого трафіку. Продакшен переписує всі правила.

  • Упевнені, але хибні відповіді. Модель авторитетним тоном цитує не ті документи: вузьке місце — це retrieval, а не генерація.
  • Невідтворювана поведінка. Той самий вхід дає різні результати, і ніхто не знає чому, бо немає ні трейсів, ні регресійного набору даних.
  • Витрати й затримка поза контролем. Багатослівні промпти, жодного кешування, жодної маршрутизації за складністю: рахунок зростає, а time-to-first-token погіршується під навантаженням.
  • Відкрита поверхня атаки. Ворожі інструкції, сховані в документі або у виводі інструмента, перехоплюють агента: prompt injection — найбільш експлуатована вразливість.
  • Жодної простежуваності. Коли користувач повідомляє про помилку, неможливо дійти до вихідного документа, чанка й запуску, що її породили.

Для команд, які ведуть ШІ від proof-of-concept до системи в продакшені, з аудитами, SLA та стелями витрат.

Шість шарів

Що робить із прототипу справжній продукт

ШІ-продукт у продакшені — це розподілена система, в якій модель є лише планувальником. Його тримають шість шарів.

Дані та прийом даних

Документи надходять через структурований парсинг, класифікацію чутливості та детерміновану редакцію PII, перш ніж досягти моделі. Кожен вивід простежується до вихідного файлу, версії політики та запуску, що його породив.

Retrieval

Видобування поєднує семантичний пошук (вектори) та лексичний пошук (BM25), злиті через Reciprocal Rank Fusion, потім cross-encoder reranker переупорядковує кандидатів. Саме тут вірність відповіді виграється або програється.

Оркестрація та агенти

Детермінований робочий процес вирішує, де ви перебуваєте в процесі; модель вирішує, що робити в межах обмеженого набору дій. Виклики інструментів ідуть стандартними протоколами, з довговічним виконанням і human-in-the-loop на діях із високим впливом.

Оцінка та спостережуваність

Золотий набір даних, побудований із реальних збоїв, оцінювачі, відкалібровані за людськими рецензентами, та шлюз у CI, що блокує регресії до релізу. Трейси дотримуються відкритих семантичних угод (OpenTelemetry GenAI), щоб залишатися сумісними.

Guardrail-обмеження та витрати

Guardrail-обмеження валідують вхід, видобутий контекст і вивід наскрізно проти prompt injection; маршрутизація за складністю, семантичне кешування та бюджети токенів тримають витрати й затримку під контролем, не погіршуючи якість.

Від даних до відповіді

Шлях одного запиту

Що проходить запит, коли архітектура повна, від шару даних до повернення відповіді.

1
Керований прийом

Документ парситься, класифікується за чутливістю, очищається від PII та індексується з тегами призначення; кожен чанк зберігає зв'язок із джерелом.

2
Retrieval і rerank

Гібридний пошук вектор + ключове слово, злиття рангів, потім cross-encoder reranking, щоб вивести нагору справді релевантні фрагменти.

3
Обмежена оркестрація

Оркестратор спрямовує запит, викликає потрібні інструменти та призупиняє агента в критичних точках прийняття рішень; кожен виклик логується.

4
Guardrail-обмеження, оцінка та повернення

Вивід перевіряється проти політики та сигналів ін'єкції, оцінюється на вибіркових трейсах, потім повертається з кешуванням і потоковою передачею для сприйманої затримки.

Шість шарів, пройдених за запит, кожен вимірюваний і простежуваний незалежно.

Прототип проти продукту

Де все змінюється

Та сама модель, інший світ. Розрив не в промпті: він у шарах навколо нього.

ВимірПрототипПродукт у продакшені
ДаніФайли, завантажені вручнуКерований прийом, PII відредаговано, простежуваний lineage
RetrievalЛише векторний пошукГібридний + reranking, вірність виміряна
КонтрольВільно блукаючий агентДетермінований робочий процес, обмежені інструменти, human-in-the-loop
ЯкістьТестується вручнуОцінки в CI на золотому наборі, шлюз регресії
Безпека та витратиЖодних guardrail-обмеженьЕшелонований захист, маршрутизація, кешування, бюджети токенів
Що ви отримуєте

Цінність шести шарів

Це не теорія архітектури: це те, що дозволяє поставити своє ім'я під відповіддю перед клієнтом або аудитом.

01

Відповіді, що витримують аудит

Кожен вивід простежується до документа, чанка та версії політики: пояснюваний, відтворюваний, захищуваний.

02

Надійність під реальним трафіком

Детермінована оркестрація та наскрізні guardrail-обмеження тримають поведінку передбачуваною навіть за ворожих, багатоорендних входів.

03

Якість, що не регресує

Оцінки в CI блокують погіршення до релізу, а не після скарги користувача.

04

Керовані витрати й затримка

Маршрутизація за складністю, семантичне кешування та бюджети токенів тримають рахунок і time-to-first-token під контролем у масштабі.

У продакшені агент — це не промпт: це розподілена система, в якій модель є планувальником.

Прямі питання

Що нас запитують клієнти

Чому відповідь упевнена, але хибна?

Майже завжди проблема вище за потоком: retrieval вивів не ті документи, і модель породила добре оформлену відповідь, засновану на хибному джерелі. Це виправляється гібридним retrieval, reranking і вимірюванням вірності, а не промптом.

Як ми захищаємося від prompt injection?

Ешелонованим захистом: класифікувати вхід і видобутий контекст до моделі, валідувати вивід проти політики й оцінювати кожну дію агента відносно початкового наміру користувача, ізолюючи недовірений проміжний контекст.

Що потрібно, окрім моделі, яка проходить оцінки?

Прототип, що проходить оцінки, — це один інгредієнт. Потрібні також золоті набори даних із реальних збоїв, трейси, шлюзи в CI, canary, відкат і runbook'и: їх інженерять, а не припускають за замовчуванням.

Кейси

Від проблеми до результату — анонімно.

Юридичні послуги · анонімізовано

Упевнена, але хибна цитата

Проблема Документний асистент відповідав авторитетним тоном, цитуючи не той контракт: у демо працювало, перед клієнтами довіра руйнувалася, бо ніхто не вмів дійти до джерела.

Метод Замінили винятково векторний пошук гібридним retrieval (вектори + BM25), злитим через Reciprocal Rank Fusion, і cross-encoder reranking, додали lineage чанк-до-джерела та міру вірності на вибіркових відповідях.

Результат Кожен вивід тепер простежується до документа, чанка та версії політики, що його обґрунтовують; нерелевантні відповіді перехоплюються до користувача, замість того щоб спливати як скарга.

Фінансові послуги · анонімізовано

Агент, перехоплений документом

Проблема Агент із доступом до інструментів виконував ворожі інструкції, сховані всередині завантажених документів і виводів інструментів: prompt injection, що відкривав поверхню атаки в багатоорендному середовищі.

Метод Запровадили ешелонований захист — класифікацію входу та видобутого контексту до моделі, валідацію виводу проти політики, ізоляцію недовіреного проміжного контексту та додавання human-in-the-loop на діях із високим впливом.

Результат Поведінка агента залишилася передбачуваною навіть за ворожих входів; кожна дія оцінюється відносно початкового наміру користувача, а виклики інструментів логуються та простежуються.

Охорона здоров'я · анонімізовано

Якість, що регресувала в тиші

Проблема Той самий вхід давав різні результати, а погіршення спливали лише після скарги користувача, бо не було ні трейсів, ні регресійного набору даних, на які можна спертися.

Метод Побудували золотий набір даних із реальних збоїв, відкалібрували оцінювачів за людськими рецензентами, додали шлюз оцінки в CI з canary і відкатом та інструментували трейси, що відповідають OpenTelemetry GenAI.

Результат Регресії блокуються до релізу, а не після скарги, і поведінка системи тепер відтворювана й досліджувана запуск за запуском.

Заглибитися ще

Перенесімо це у ваш стек.