跳至内容

AI Products · 深度解读

生产环境中 AI 产品的架构:从数据到护栏

将原型转变为可靠 AI 产品的六个层级:受治理的数据摄入、可度量的检索、确定性编排、CI 中的评测、端到端护栏,以及对成本和时延的控制。

Software house — su misura, costruito da noi

AI 产品 · 生产级架构

输入 · 原始请求 + 数据源

产出 · 可上线、可追溯、可信赖的答案

01

数据与摄取(血缘追溯、PII 脱敏)

每个文档先经过结构化解析、敏感度分类和确定性 PII 脱敏,然后才接触模型,并且每个分块都保留其与源文件、策略版本和产生它的那次运行的链接:没有这一层,任何回答都经不起审计。

02

检索(混合搜索 + 重排序)

检索通过 Reciprocal Rank Fusion 融合语义向量搜索与词法 BM25 搜索,再由 cross-encoder 重排器对候选重新排序,把真正相关的段落顶到前面:回答的忠实度在此处赢得或失去。

03

编排(受限智能体、工具调用)

确定性工作流决定你处于流程的哪一步,而模型在受限的动作集合内选择做什么,工具调用走标准协议,具备持久执行,并对高影响动作引入人工介入:智能体即使在负载下也保持可预测。

04

评测与可观测性(CI 内评测、链路追踪)

由真实失败构建的黄金数据集、对照人工评审校准的评分器,以及 CI 中的关卡在发布前阻断回归,追踪遵循开放的语义约定(OpenTelemetry GenAI)以保持可互操作和可调查。

05

护栏与安全(输入/输出、注入防护)

护栏端到端地针对提示注入——被利用最多的漏洞——校验输入、检索到的上下文和输出,对不可信的中间上下文进行分类,并将每个动作对照用户的原始意图进行评估。

06

成本与延迟(路由、缓存、TTFT)

按复杂度路由、语义缓存和 token 预算把成本和首字时延控制住,并以流式传输改善感知时延,使账单不会失控、质量不会随流量增长而退化。

要点

演示令人信服,产品却崩塌

AI 原型之所以能运行,是因为它跑在已知输入上、单租户、没有对抗性流量。生产环境改写了每一条规则。

  • 自信却错误的回答。 模型以权威的口吻引用了错误的文档:瓶颈在检索,而非生成。
  • 无法复现的行为。 同一输入产生不同结果,没人知道为什么,因为既没有追踪也没有回归数据集。
  • 成本与时延失控。 冗长的提示、没有缓存、没有按复杂度路由:账单不断增长,首字时延在负载下恶化。
  • 敞开的攻击面。 藏在文档或工具输出中的恶意指令劫持了智能体:提示注入是被利用最多的漏洞。
  • 毫无可追溯性。 当用户报告错误时,无法回溯到产生它的源文档、分块和那次运行。

面向那些将 AI 从概念验证带到生产系统的团队,需要审计、SLA 和成本上限。

六个层级

是什么让原型成为真正的产品

生产环境中的 AI 产品是一个分布式系统,其中模型只是规划者。六个层级支撑着它。

数据与摄入

文档先经过结构化解析、敏感度分类和确定性 PII 脱敏,然后才接触模型。每个输出都可回溯到源文件、策略版本以及产生它的那次运行。

检索

检索将语义搜索(向量)与词法搜索(BM25)结合,经 Reciprocal Rank Fusion 融合,再由 cross-encoder 重排器对候选重新排序。回答的忠实度在此处赢得或失去。

编排与智能体

确定性工作流决定你处于流程的哪一步;模型在受限的动作集合内决定做什么。工具调用走标准协议,具备持久执行,并对高影响动作引入人工介入。

评测与可观测性

由真实失败构建的黄金数据集、对照人工评审校准的评分器,以及在 CI 中阻断回归的关卡。追踪遵循开放的语义约定(OpenTelemetry GenAI)以保持可互操作。

护栏与成本

护栏端到端地针对提示注入校验输入、检索到的上下文和输出;按复杂度路由、语义缓存和 token 预算在不削弱质量的前提下控制成本与时延。

从数据到回答

单次请求的旅程

当架构完整时,一次请求所穿越的路径,从数据层到返回回答。

1
受治理的摄入

文档被解析、按敏感度分类、剥离 PII,并以用途标签建立索引;每个分块都保留其与源的链接。

2
检索与重排

向量 + 关键词的混合搜索、排名融合,再做 cross-encoder 重排,把真正相关的段落顶到前面。

3
受约束的编排

编排器路由请求、调用所需工具,并在关键决策点暂停智能体;每次调用都被记录。

4
护栏、评测与返回

输出针对策略和注入信号进行校验,在抽样追踪上评测,然后带着缓存与流式传输返回,以改善感知时延。

每次请求穿越六个层级,每一层都可独立度量和追溯。

原型 vs 产品

一切改变之处

同样的模型,不同的世界。差距不在提示里:它在环绕提示的各层之中。

维度原型生产环境产品
数据手动上传的文件受治理的摄入、PII 已脱敏、可追溯的血缘
检索仅向量搜索混合 + 重排,忠实度可度量
控制自由游走的智能体确定性工作流、受约束的工具、人工介入
质量手动测试在黄金数据集上于 CI 中评测、回归关卡
安全与成本没有护栏纵深防御、路由、缓存、token 预算
你将得到

六个层级的价值

这不是架构理论:而是让你能在客户或审计面前为一个回答署名的东西。

01

经得起审计的回答

每个输出都可回溯到文档、分块和策略版本:可解释、可复现、可辩护。

02

真实流量下的可靠性

确定性编排和端到端护栏即使在对抗性、多租户输入下也能让行为保持可预测。

03

不退化的质量

CI 中的评测在发布前就阻断劣化,而不是在用户投诉之后。

04

受治理的成本与时延

按复杂度路由、语义缓存和 token 预算在规模化时把账单和首字时延控制住。

在生产中,智能体不是一个提示:它是一个分布式系统,其中模型是规划者。

直接的问题

客户问我们的问题

为什么回答自信却错误?

问题几乎总在上游:检索调出了错误的文档,模型据此产生了一个格式良好却基于错误来源的回答。修复它靠的是混合检索、重排和忠实度度量,而非提示。

我们如何防御提示注入?

靠纵深防御:在进入模型前对输入和检索到的上下文进行分类,针对策略校验输出,并将智能体的每个动作对照用户的原始意图进行评估,同时隔离不可信的中间上下文。

除了一个通过评测的模型,还需要什么?

通过评测的原型只是一种成分。你还需要来自真实失败的黄金数据集、追踪、CI 关卡、金丝雀、回滚和运行手册:这些是被工程化出来的,而非想当然。

案例笔记

从问题到结果——已匿名。

法律服务 · 已匿名

自信却错误的引用

问题 一个文档助手以权威口吻作答,却引用了错误的合同:在演示中能用,在客户面前却让信任崩塌,因为没人能追溯来源。

方法 用混合检索(向量 + BM25,经 Reciprocal Rank Fusion 融合)和 cross-encoder 重排替换了仅向量搜索,加入了分块到源的血缘,并对抽样回答做忠实度度量。

结果 如今每个输出都可回溯到支撑它的文档、分块和策略版本;不相关的回答在到达用户之前就被拦截,而不是以投诉的形式浮现。

金融服务 · 已匿名

被文档劫持的智能体

问题 一个使用工具的智能体执行了藏在上传文档和工具输出中的恶意指令:一次提示注入在多租户环境中打开了攻击面。

方法 引入纵深防御——在进入模型前对输入和检索到的上下文分类、针对策略校验输出、隔离不可信的中间上下文,并对高影响动作加入人工介入。

结果 即使面对对抗性输入,智能体行为也保持可预测;每个动作都对照用户的原始意图进行评估,工具调用被记录且可追溯。

医疗健康 · 已匿名

悄然退化的质量

问题 同一输入产生不同结果,劣化只在用户投诉之后才浮现,因为既没有追踪也没有可依凭的回归数据集。

方法 从真实失败构建黄金数据集,对照人工评审校准评分器,加入带金丝雀和回滚的 CI 评测关卡,并对符合 OpenTelemetry GenAI 的追踪进行埋点。

结果 回归在发布前就被阻断,而不是在投诉之后,系统行为如今可逐次运行地复现和调查。

继续深入

把它带入你的技术栈。