Перейти к содержимому

AI Products · Подробно

Архитектура продукта на базе ИИ в продакшене: от данных до guardrail-ограждений

Шесть слоёв, которые превращают прототип в надёжный ИИ-продукт: управляемый приём данных, измеримый retrieval, детерминированная оркестрация, оценки в CI, сквозные guardrail-ограждения и контроль затрат и задержки.

Software house — su misura, costruito da noi

AI-ПРОДУКТ · ПРОДАКШЕН-АРХИТЕКТУРА

Вход · Сырой запрос + источники

Выход · Ответ, который можно выпустить, отследить и которому можно доверять

01

Данные и загрузка (происхождение, маскирование PII)

Каждый документ поступает через структурированный парсинг, классификацию чувствительности и детерминированную редакцию PII, прежде чем достичь модели, и каждый чанк сохраняет связь с исходным файлом, версией политики и запуском, который его породил: без этого слоя ни один ответ не выдержит аудит.

02

Поиск (гибридный + реранжирование)

Retrieval сливает семантический векторный поиск и лексический поиск BM25 через Reciprocal Rank Fusion, затем cross-encoder reranker переупорядочивает кандидатов, чтобы вывести наверх действительно релевантные фрагменты: именно здесь верность ответа выигрывается или проигрывается.

03

Оркестрация (ограниченный агент, вызовы инструментов)

Детерминированный рабочий процесс решает, где вы находитесь в процессе, пока модель выбирает, что делать в пределах ограниченного набора действий, с вызовами инструментов по стандартным протоколам, долговечным исполнением и human-in-the-loop на действиях с высоким влиянием: агент остаётся предсказуемым даже под нагрузкой.

04

Оценка и наблюдаемость (evals в CI, трейсинг)

Золотой набор данных, построенный из реальных сбоев, оценщики, откалиброванные по человеческим рецензентам, и шлюз в CI блокируют регрессии до релиза, с трейсами, следующими открытым семантическим соглашениям (OpenTelemetry GenAI), чтобы оставаться совместимыми и исследуемыми.

05

Защитные ограничения и безопасность (вход/выход, инъекции)

Guardrail-ограждения валидируют вход, извлечённый контекст и вывод сквозным образом против prompt injection — наиболее эксплуатируемой уязвимости — классифицируя недоверенный промежуточный контекст и оценивая каждое действие относительно исходного намерения пользователя.

06

Стоимость и задержка (роутинг, кеширование, TTFT)

Маршрутизация по сложности, семантическое кэширование и бюджеты токенов держат под контролем затраты и time-to-first-token, с потоковой передачей для воспринимаемой задержки, так что счёт не взрывается, а качество не ухудшается по мере роста трафика.

Суть

Демо убеждает, продукт рушится

Прототип ИИ работает, потому что он работает на известных входах, в single-tenant, без враждебного трафика. Продакшен переписывает все правила.

  • Уверенные, но неверные ответы. Модель авторитетным тоном цитирует не те документы: узкое место — это retrieval, а не генерация.
  • Невоспроизводимое поведение. Один и тот же вход даёт разные результаты, и никто не знает почему, потому что нет ни трейсов, ни регрессионного набора данных.
  • Затраты и задержка вне контроля. Многословные промпты, никакого кэширования, никакой маршрутизации по сложности: счёт растёт, а time-to-first-token ухудшается под нагрузкой.
  • Открытая поверхность атаки. Враждебные инструкции, спрятанные в документе или в выводе инструмента, перехватывают агента: prompt injection — наиболее эксплуатируемая уязвимость.
  • Никакой прослеживаемости. Когда пользователь сообщает об ошибке, невозможно дойти до исходного документа, чанка и запуска, которые её породили.

Для команд, которые ведут ИИ от proof-of-concept к системе в продакшене, с аудитами, SLA и потолками затрат.

Шесть слоёв

Что делает из прототипа настоящий продукт

ИИ-продукт в продакшене — это распределённая система, в которой модель является лишь планировщиком. Его держат шесть слоёв.

Данные и приём данных

Документы поступают через структурированный парсинг, классификацию чувствительности и детерминированную редакцию PII, прежде чем достичь модели. Каждый вывод прослеживается до исходного файла, версии политики и запуска, который его породил.

Retrieval

Извлечение сочетает семантический поиск (векторы) и лексический поиск (BM25), слитые через Reciprocal Rank Fusion, затем cross-encoder reranker переупорядочивает кандидатов. Именно здесь верность ответа выигрывается или проигрывается.

Оркестрация и агенты

Детерминированный рабочий процесс решает, где вы находитесь в процессе; модель решает, что делать в пределах ограниченного набора действий. Вызовы инструментов идут по стандартным протоколам, с долговечным исполнением и human-in-the-loop на действиях с высоким влиянием.

Оценка и наблюдаемость

Золотой набор данных, построенный из реальных сбоев, оценщики, откалиброванные по человеческим рецензентам, и шлюз в CI, блокирующий регрессии до релиза. Трейсы следуют открытым семантическим соглашениям (OpenTelemetry GenAI), чтобы оставаться совместимыми.

Guardrail-ограждения и затраты

Guardrail-ограждения валидируют вход, извлечённый контекст и вывод сквозным образом против prompt injection; маршрутизация по сложности, семантическое кэширование и бюджеты токенов держат затраты и задержку под контролем, не ухудшая качество.

От данных к ответу

Путь одного запроса

Что проходит запрос, когда архитектура полна, от слоя данных до возврата ответа.

1
Управляемый приём

Документ парсится, классифицируется по чувствительности, очищается от PII и индексируется с тегами назначения; каждый чанк сохраняет связь с источником.

2
Retrieval и rerank

Гибридный поиск вектор + ключевое слово, слияние рангов, затем cross-encoder reranking, чтобы вывести наверх действительно релевантные фрагменты.

3
Ограниченная оркестрация

Оркестратор направляет запрос, вызывает нужные инструменты и приостанавливает агента в критических точках принятия решений; каждый вызов логируется.

4
Guardrail-ограждения, оценка и возврат

Вывод проверяется против политики и сигналов инъекции, оценивается на выборочных трейсах, затем возвращается с кэшированием и потоковой передачей для воспринимаемой задержки.

Шесть слоёв, пройденных за запрос, каждый измеримый и прослеживаемый независимо.

Прототип против продукта

Где всё меняется

Та же модель, другой мир. Разрыв не в промпте: он в слоях вокруг него.

ИзмерениеПрототипПродукт в продакшене
ДанныеФайлы, загруженные вручнуюУправляемый приём, PII отредактирован, прослеживаемый lineage
RetrievalТолько векторный поискГибридный + reranking, верность измерена
КонтрольСвободно блуждающий агентДетерминированный рабочий процесс, ограниченные инструменты, human-in-the-loop
КачествоТестируется вручнуюОценки в CI на золотом наборе, шлюз регрессии
Безопасность и затратыНикаких guardrail-огражденийЭшелонированная защита, маршрутизация, кэширование, бюджеты токенов
Что вы получаете

Ценность шести слоёв

Это не теория архитектуры: это то, что позволяет поставить своё имя под ответом перед клиентом или аудитом.

01

Ответы, которые выдерживают аудит

Каждый вывод прослеживается до документа, чанка и версии политики: объяснимый, воспроизводимый, защитимый.

02

Надёжность под реальным трафиком

Детерминированная оркестрация и сквозные guardrail-ограждения держат поведение предсказуемым даже при враждебных, многоарендных входах.

03

Качество, которое не регрессирует

Оценки в CI блокируют ухудшения до релиза, а не после жалобы пользователя.

04

Управляемые затраты и задержка

Маршрутизация по сложности, семантическое кэширование и бюджеты токенов держат счёт и time-to-first-token под контролем в масштабе.

В продакшене агент — это не промпт: это распределённая система, в которой модель является планировщиком.

Прямые вопросы

Что нас спрашивают клиенты

Почему ответ уверенный, но неверный?

Почти всегда проблема выше по потоку: retrieval вывел не те документы, и модель породила хорошо оформленный ответ, основанный на неверном источнике. Это исправляется гибридным retrieval, reranking и измерением верности, а не промптом.

Как мы защищаемся от prompt injection?

Эшелонированной защитой: классифицировать вход и извлечённый контекст до модели, валидировать вывод против политики и оценивать каждое действие агента относительно исходного намерения пользователя, изолируя недоверенный промежуточный контекст.

Что нужно помимо модели, которая проходит оценки?

Прототип, проходящий оценки, — это один ингредиент. Нужны также золотые наборы данных из реальных сбоев, трейсы, шлюзы в CI, canary, откат и runbook'и: их инженерят, а не предполагают по умолчанию.

Кейсы

От задачи к результату — анонимно.

Юридические услуги · анонимизировано

Уверенная, но неверная цитата

Задача Документный ассистент отвечал авторитетным тоном, цитируя не тот контракт: в демо работало, перед клиентами доверие рушилось, потому что никто не умел дойти до источника.

Метод Заменили исключительно векторный поиск гибридным retrieval (векторы + BM25), слитым через Reciprocal Rank Fusion, и cross-encoder reranking, добавили lineage чанк-к-источнику и меру верности на выборочных ответах.

Результат Каждый вывод теперь прослеживается до документа, чанка и версии политики, которые его обосновывают; нерелевантные ответы перехватываются до пользователя, вместо того чтобы всплывать как жалоба.

Финансовые услуги · анонимизировано

Агент, перехваченный документом

Задача Агент с доступом к инструментам исполнял враждебные инструкции, спрятанные внутри загруженных документов и выводов инструментов: prompt injection, открывавший поверхность атаки в многоарендной среде.

Метод Внедрили эшелонированную защиту — классификацию входа и извлечённого контекста до модели, валидацию вывода против политики, изоляцию недоверенного промежуточного контекста и добавление human-in-the-loop на действиях с высоким влиянием.

Результат Поведение агента осталось предсказуемым даже при враждебных входах; каждое действие оценивается относительно исходного намерения пользователя, а вызовы инструментов логируются и прослеживаются.

Здравоохранение · анонимизировано

Качество, которое регрессировало в тишине

Задача Один и тот же вход давал разные результаты, а ухудшения всплывали лишь после жалобы пользователя, потому что не было ни трейсов, ни регрессионного набора данных, на которые можно опереться.

Метод Построили золотой набор данных из реальных сбоев, откалибровали оценщиков по человеческим рецензентам, добавили шлюз оценки в CI с canary и откатом и инструментировали трейсы, соответствующие OpenTelemetry GenAI.

Результат Регрессии блокируются до релиза, а не после жалобы, и поведение системы теперь воспроизводимо и исследуемо запуск за запуском.

Углубиться дальше

Перенесём это в ваш стек.