AI Solutions · Подробно
База знаний RAG: ответы, привязанные к источникам, а не выдуманные
Мы строим базы знаний, которые отвечают только на основе проверенных источников: гибридный поиск, привязка к документам, прослеживаемые цитаты, контроль галлюцинаций и непрерывная оценка качества ответов. Когда источника недостаточно, система заявляет об этом, а не выдумывает.
БАЗА ЗНАНИЙ · ОБОСНОВАННЫЙ ПОИСК
Вход · Вопрос пользователя
Выход · Проверяемый ответ с цитатами
Загрузка источников истины и чанкинг
Нормализует исходные документы и разбивает их на связные фрагменты, размер которых задаётся типом контента, прикрепляя к каждому метаданные источника — заголовок, раздел, дату, права — которые становятся основой цитат и контроля доступа: без чистого приёма всё последующее цитирует пустоту.
Гибридный поиск (ключевые слова + семантика)
Сочетает поиск по ключевым словам (BM25), ловящий коды продуктов, имена собственные и точные редкие термины, с семантическим векторным поиском, ловящим перефразировки и понятия, сливая два набора результатов по рангу (RRF), чтобы извлечь то, чего ни один из них не нашёл бы в одиночку.
Реранжирование шорт-листа
Переранжировщик cross-encoder переупорядочивает только узкий короткий список лучших кандидатов, оценивая вопрос и фрагмент вместе, а не по отдельности, добавляя этап точности, который остаётся точным именно потому, что работает на нескольких фрагментах, а не на всём индексе.
Генерация с опорой на источники и цитатами
Модель отвечает исключительно из верхушки короткого списка и цитирует источник каждого утверждения, так что каждая фраза остаётся прослеживаемой до документа, версии и раздела, а не тонет в памяти обучения.
Проверка обоснованности и релевантности / отказ
Перед выдачей проверка привязки и релевантности сравнивает ответ с извлечёнными фрагментами: ниже порога система воздерживается, переискивает или передаёт человеку, потому что честное «этого нет в источниках» стоит больше правдоподобной выдумки.
Оценка качества ответа и свежесть данных
Верность, релевантность контекста, релевантность ответа, точность цитат и freshness индекса измеряются непрерывно, потому что единая оценка скрывает, где живёт проблема, а надёжную базу нужно держать честной, пока документы и права меняются.
Признаки базы знаний, которая выдумывает
Ассистент, отвечающий уверенно, ничего не стоит, если эта уверенность не привязана к источнику. Вот симптомы, которые мы видим, прежде чем вмешаться.
- Уверенно, но неверно. Система авторитетным тоном утверждает то, чего нет ни в одном внутреннем документе: это отсутствие привязки, а не опечатка.
- Нет проверяемых цитат. Пользователь не может проследить фразу до её источника, а значит не может ни доверять ей, ни исправить её; каждый ответ — чёрный ящик.
- Устаревший контент выдаётся за актуальный. Политика, обновлённая на прошлой неделе, ещё не в индексе, и система продолжает цитировать старую версию с той же уверенностью.
- Утечки периметра. Пользователь получает фрагменты документов, которые в исходной системе он не имел бы права видеть.
- Вопросы вне области без тормоза. Когда источников не хватает, модель заполняет пробел выдумкой вместо того, чтобы заявить, что не знает.
Для команд, управляющих критической документацией, поддержкой, комплаенсом или внутренними знаниями и не имеющих права на выдуманный ответ перед клиентом или аудитором.
Сначала найти, потом сгенерировать
Генеративная модель, предоставленная самой себе, предсказывает правдоподобный текст. База знаний RAG переворачивает порядок: сначала извлекает доказательства из ваших источников, а затем заставляет модель отвечать только в пределах этих доказательств.
Retrieval-Augmented Generation
Перед ответом система ищет в документах релевантные фрагменты и передаёт их модели как контекст с указанием отвечать только оттуда. Модель перестаёт черпать из памяти обучения и черпает из вашего эталонного источника.
Привязка ≠ правильность
Привязка проверяет, верен ли ответ извлечённому тексту, а не истинен ли он в абсолюте. Если поиск вытащил неверный фрагмент, высокая оценка привязки означает лишь, что модель точно повторила неверное — поэтому поиск и оценку нужно рассматривать как две разные задачи.
Источник истины, а не копия
Индекс не заменяет ваши исходные системы; он их отражает. Когда документ меняется в источнике, индекс должен измениться вместе с ним, иначе база знаний уверенно лжёт о том, что верно сегодня.
Воздержаться — это функция, а не дефект
Надёжная база знаний умеет сказать «этого нет в источниках». Честное воздержание лучше выдуманного ответа: ценность для предприятия — в том, чтобы не ошибаться, а не в том, чтобы всегда отвечать.
От источника к цитированному ответу
Каждый слой сужает то, что модели позволено говорить. Конвейер — это не одна модель: это цепочка контролей, у каждого из которых измеримая задача.
Документы нормализуются и разбиваются на связные фрагменты, размер которых задаётся типом контента: политика сегментируется иначе, чем техническая спецификация. К каждому фрагменту прикрепляются метаданные источника — заголовок, раздел, дата, права — которые становятся основой цитат и контроля доступа.
Поиск по ключевым словам (BM25) ловит коды продуктов, имена собственные и точные редкие термины; семантический векторный поиск ловит перефразировки и понятия. Два набора результатов сливаются по рангу (RRF), извлекая то, чего ни один из них не нашёл бы в одиночку.
Переранжировщик cross-encoder упорядочивает несколько лучших кандидатов, оценивая вопрос и фрагмент вместе, а не по отдельности. Это второй этап точности, работающий на коротком списке, а не на всём индексе — поэтому он точен, не будучи медленным.
Модель отвечает только из верхушки короткого списка и цитирует источник каждого утверждения. Перед выдачей проверка привязки и релевантности сравнивает ответ с фрагментами: ниже порога система воздерживается или переискивает вместо публикации.
От источника к цитированному ответу за миллисекунды, с каждым утверждением, прослеживаемым до фрагмента.
Метрики, отличающие надёжную базу от правдоподобной
Базу знаний оценивают по отдельным измерениям, потому что единая оценка скрывает, где живёт проблема. Вот рычаги, которые мы отслеживаем непрерывно.
| Измерение | Что проверяет | Почему важно |
|---|---|---|
| Faithfulness (верность) | Каждое утверждение ответа подкреплено извлечёнными фрагментами | Прямой тормоз галлюцинаций: нет источника — нет утверждения |
| Релевантность контекста | Извлечённые фрагменты действительно относятся к вопросу | Измеряет поиск: если он плох, даже верный ответ верен неверному |
| Релевантность ответа | Ответ действительно отвечает на заданный вопрос, не уходя в сторону | Отличает уместное от обобщённо верного, но бесполезного |
| Точность цитат | Каждая цитата указывает на фрагмент, который действительно подкрепляет фразу | Делает ответ проверяемым: пользователь возвращается к источнику и сверяет |
| Freshness | Индекс отражает текущее состояние исходных документов | Несвежий индекс выдаёт ответы, уверенные, но сегодня неверные |
Контроли, которые мы держим включёнными в продакшене
Построить конвейер — половина работы. Другая половина — держать его честным со временем, пока документы, права и вопросы меняются.
Контроль доступа внутри поиска
Права — это фильтр по метаданным в момент поиска: документ, который пользователь не может видеть в источнике, никогда не появляется в результатах. Периметр безопасности путешествует вместе с данными.
Инкрементное индексирование
Когда источник меняется, переобрабатывается только изменённое, а индекс обновляется стабильными идентификаторами. Никаких полных перестроек, никаких окон, в которых база отвечает из старых версий.
Пороги воздержания
Ниже порога привязки или релевантности ответ не уходит: система заявляет, что не знает, переискивает или передаёт человеку. Правило области явное, а не оставлено на волю случая.
Происхождение и источник истины
Каждый ответ несёт с собой происхождение своих утверждений — какой документ, какая версия, какой раздел — в духе открытых стандартов происхождения контента, таких как C2PA: история утверждения проверяема.
Надёжная база знаний — не та, что всегда отвечает, а та, что не отвечает, когда не должна.
О чём команды спрашивают, прежде чем мы начнём
Полностью ли RAG устраняет галлюцинации?
Нет, и остерегайтесь тех, кто это обещает. Он существенно их сокращает, привязывая каждый ответ к реальным источникам, а проверки привязки плюс пороги воздержания останавливают неподкреплённые ответы до их выхода. Цель — проверяемый ответ, а не акт веры.
Что происходит, когда ответа нет в документах?
Система это заявляет. Мы определяем с вами правило области: явное воздержание, повторный поиск или эскалация к человеку. Честное «этого нет в источниках» лучше правдоподобной выдумки.
Как ответы остаются актуальными?
Через инкрементное индексирование: когда документ меняется в источнике, индекс обновляется только для изменённой части, без полной перестройки. Freshness — это метрика, которую мы отслеживаем, а не редкое событие.
Кейсы
От задачи к результату — анонимно.
Полисы цитируются, а не воображаются
Задача Ассистент поддержки уверенно отвечал о пунктах и лимитах покрытия, опираясь на устаревшие версии полисов, при этом оператор не мог проследить фразу до её источника.
Метод Приём «источник истины» с метаданными версии и раздела, гибридный поиск по условиям договора, привязанная генерация, цитирующая каждый пункт, и порог воздержания, когда фрагмент не подкрепляет ответ.
Результат Каждый ответ несёт с собой свой документ, версию и раздел; когда информации нет в источниках, система это заявляет вместо выдумки, и оператор может проверить, прежде чем говорить с клиентом.
Спецификации без утечек периметра
Задача Внутренняя база знаний возвращала техникам из разных отделов фрагменты конфиденциальной документации, которые в исходной системе они не имели бы права видеть.
Метод Контроль доступа как фильтр по метаданным в момент поиска — периметр безопасности путешествует вместе с данными — плюс нарезка по типу контента, сегментирующая спецификацию иначе, чем процедуру.
Результат Документ, который пользователь не может видеть в источнике, никогда не появляется в результатах; ответы остаются цитированными и проверяемыми, не раскрывая материал вне периметра.
Процедуры актуальны на нужную неделю
Задача Клинические процедуры часто менялись, но индекс, перестраиваемый по расписанию, оставлял окна, в которых система цитировала старую версию с той же уверенностью, что и текущую.
Метод Инкрементное индексирование со стабильными идентификаторами, переобрабатывающее только то, что меняется в источнике, плюс freshness, рассматриваемая как непрерывно отслеживаемая метрика наряду с верностью и точностью цитат.
Результат Никаких полных перестроек и никаких окон расхождения: индекс отражает текущее состояние документов, и ответы перестают быть уверенными, но сегодня неверными.
Углубиться дальше
От индекса к продукту в продакшене→
Привязанный поиск — это один слой; остальные пять, что выдерживают реальный трафик.
Управлять внедрением, а не только конвейером→
Кто и о чём может спрашивать, с какими правами и какими явными правилами области.
Проверяемое происхождение утверждений→
Прослеживание источника вывода в духе открытых стандартов, таких как C2PA.