跳至内容

Insights · AI

RAG 与治理:不靠猜测的 AI

可靠的答案来自你的资料来源,而非模型的猜测。检索、规则与人工把关共同降低风险。

问题所在

语言模型为什么会编造,以及为什么仅仅告诉它别这样做并不够

模型并不知道,它只是在预测

语言模型回答时并不会去查阅档案:它只是根据上下文生成最可能的词语序列。当问题涉及不在其训练数据中的信息,或在训练之后发生了变化的信息时,模型不会停下来,也不会说“我不知道”。它会继续生成听起来合理的文本,用的语气与给出正确答案时一样自信。这就是所谓“幻觉”背后的机制:它们不是偶发的、可以修补的故障,而是一个为流畅性而非真实性优化的工具的自然行为。

听起来合理不等于真实

最大的风险不是一眼就能识破的明显错误答案,而是貌似可信的答案:一条并不存在的法规引用、一条被自信引用却纯属虚构的合同条款、一个为了把句子补完整而插入的日期或数字。在企业环境中,这会把一个有用的工具变成运营风险和声誉风险的来源。要求模型“要准确”解决不了问题,因为模型无法区分自己记得的内容和当场编造的内容。

正确的转变:从记忆到来源

突破不在于选择更大的模型,而在于改变答案的来源。与其让模型从它的统计记忆中提取内容,不如在提问的那一刻把相关材料交给它,并要求它只基于这些材料作答。模型不再充当档案库,而成为负责归纳的读者。这就是 RAG(检索增强生成)的核心思想:先检索,再生成。

工作原理

先检索,后生成:一个可靠答案的解剖图

检索

当问题到来时,系统并不会直接把它交给模型。它会先在你的文档中——页面、合同、流程、产品资料——搜索与这一具体请求最相关的段落。这个检索阶段是整个机制的核心:如果找到了正确的材料,答案就有了根基;如果找到的材料不准确或缺失,任何模型都无法弥补。检索的质量比模型的能力更重要。

受约束的生成

直到此时模型才登场,并收到一条明确的指令:只使用所提供的段落作答;如果信息不在其中,就直说。这与自由使用的差别一目了然。模型不再需要猜测:它要做的是阅读、筛选并重新表述眼前的内容。它的语言才能服务于你的文档,而不是它的想象力。

引用即证据

严肃的答案会标明出处。每一条重要论断都应能追溯到它所依据的文档段落,让人在几秒钟内就能核实。引用不是装饰性的细节:它让答案变得可审计。没有可追溯性,即使正确的答案也只是一种盲信;有了可追溯性,它就成为可以验证的陈述。

关键杠杆

幻觉风险真正得以降低的地方

01

为来源划定清晰边界

系统只从一组定义明确、保持更新的文档中作答,而不是从整个互联网或模型的内部记忆中作答。收窄来源范围,是防止答案滑向未经核实信息的第一道防线。

一份过时的内部流程被从档案库中撤下,立刻不再为答案提供素材。
02

模型有权说“我不知道”

必须明确要求并奖励“弃答”:当来源中没有答案时,系统必须如实说明,而不是填补空白。一句“现有文档中没有这一信息”比一个编造的答案更有价值。

被问到一条并不存在的条款时,系统回答找不到它,而不是凭记忆重新拼凑。
03

更新来源,而非重新训练

当政策变化时,只需更新文档,答案就会随之改变,无需触碰模型。这让系统与企业当下的实际保持一致,减少基于过时信息的回答。

今天发布的新退货条款,明天就已体现在答案中。
04

可核验的追溯性

每个答案都附带其来源引用,读者可以自行核对。可验证性把盲目的信任变成知情的信任,并使系统出错时可以被纠正。

在一条法规相关的答案旁边,出现指向被引用条文确切段落的链接。
敏感之处

治理、隐私与 GDPR:让对的人获得对的检索结果

可检索不等于可公开

让系统访问企业文档带来一个控制问题:并非所有可检索的内容都应该对任何人开放。提问者的权限必须同样作用于检索环节。团队成员不应通过一条归纳后的答案,获得他打开原始文档时无权阅读的信息。访问治理不是系统之上的一层外壳:它是系统本身的一部分。

个人数据与最小化原则

当来源包含个人数据时,GDPR 的各项原则同样适用,就像对任何其他处理活动一样:合法依据、数据最小化、明确目的、限期保存。这意味着要有意识地决定哪些内容进入可检索的档案库、哪些不进入,并对敏感类别格外谨慎。问题不只是“系统答得好不好”,而是“它使用的数据是否有权使用,是否用于当初收集这些数据的目的”。

日志、留存与问责

受治理的系统会留下痕迹:查阅了哪些来源、给出了什么答案、何时给出。这有助于核查、纠错和证明合规,但它本身也需要规范,因为日志同样可能包含个人数据,需要相应的留存政策。成熟的治理不止于让系统运转:它界定谁对什么负责,以及信息可供查阅多长时间。

TMM 的思考方式

TMM 在将基于来源的系统投入生产时如何思考

1
划定来源范围

在谈论模型之前,先确定系统可以使用哪些文档、归谁所有、多久更新一次。清晰的范围是每个可靠答案的前提。

2
梳理权限与个人数据

核查谁能看到什么、个人数据存放在哪里,使系统的访问权限与人员的实际权限保持一致,并从设计阶段就贯彻最小化原则。

3
落实来源约束

将系统配置为只基于检索到的材料作答,并在来源不足时声明信息缺失。弃答被视为正确的回答,而不是失败。

4
把人放在关键节点上

对影响最大的场景,系统的答案只是草稿,需经人工审阅后才能定稿。人工把关并不会拖慢一切:它集中在出错代价最高的地方。

5
度量、追踪、纠正

观察真实的回答,核验引用,找出检索的薄弱环节,并在来源层面采取行动。系统通过更新文档来改进,而不是一味追逐越来越大的模型。

一条循序渐进的路径,而不是一个一拨即开的开关

常见问题

常见问题

RAG 能彻底消除幻觉吗?

不能。它能大幅减少幻觉,但无法降为零。把模型锚定在你的来源上,会让编造变得困难得多,并使每个答案都可以核验,但误差空间依然存在:不准确的检索或牵强的归纳仍可能产生偏差。正因如此,对关键场景的人工把关和核验引用的能力才如此重要。

我们需要用自己的数据重新训练模型吗?

几乎不需要,而且这很少是首先该做的事。在大多数情况下,在提问时提供文档更有效也更安全:你更新一个来源,答案随之改变,无需改动模型,也不会把你的数据永久固化进去。这同时是更尊重隐私的做法,因为数据始终留在你掌控的来源之中。

如果某份文档有误或已过时会怎样?

系统会按照那份文档作答,因为它信任你提供的来源。这正是核心所在:答案的质量取决于档案库的质量和新鲜度。因此来源维护——撤下过时内容、更新变化内容——是系统不可分割的一部分,而不是可有可无的附加工作。

我们能控制谁看到哪些信息吗?

能,而且这是一项硬性要求,不是可选项。检索必须遵守提问者的权限:任何人都不应通过答案获得其无权直接阅读的内容。再加上个人数据最小化和日志留存政策,正是这些让系统与 GDPR 及你的内部规则保持兼容。

把想法变成 Brief