让 AI 少编:控制幻觉的几种工程手段

幻觉无法根除,但可以大幅降低影响。本文说明限定作答范围、要求给出处、设置不知道的出口,以及为什么置信度分数不可直接采信。

要点速览
  • 幻觉是生成式模型的固有特性,工程上只能降低概率与控制代价,不能消除。
  • 限定只依据检索材料作答是最有效的一条,但材料不足时仍可能拼接出答案。
  • 出处必须由检索环节提供,让模型自己生成出处会出现编造的文档名。
  • 必须给「不知道」留出口,并在考核上同时看准确率与转人工率。
  • 置信度反映生成确定性而非内容真伪,自信且错误是最危险的一类。

模型会编造看起来合理但不存在的内容,这是生成式模型的固有特性,不是某一家的缺陷。工程上能做的不是消除它,而是把它发生的概率降下来、把发生之后的代价控制住。

限定作答范围

最有效的一条是让模型只依据检索到的材料作答,并在提示里明确:材料里没有的内容不要补充。这与开放式问答是两种用法 —— 后者本来就鼓励模型调用自身知识,而企业场景里那正是风险来源。

需要注意这只是降低而非杜绝。材料不足时,模型仍可能把几段不相关的内容拼成一个看似完整的答案,所以下面几条要配合使用。

强制给出处

要求每个结论都附上它依据的文档与章节,并把出处显示给用户。这一条有两个作用:用户可以自己核对,以及模型在需要给出具体出处时,编造的倾向会下降 —— 因为它必须把答案绑定到实际检索到的片段上。

前提是出处必须真实可点。显示一个编造的文档名比不显示更糟,所以出处应当由检索环节直接提供,而不是让模型自己生成。

给「不知道」一个出口

如果系统设计成必须给出答案,模型就会在没有依据时也给一个。应当明确允许并鼓励回答「现有资料里没有这项说明」,并给出下一步 —— 转人工、或者指向相关的联系方式。

这一条在验收指标上要配套:如果考核只看「回答率」,那么实现者就会把不知道的出口关掉。合理的做法是同时考核准确率与转人工率,并接受一定比例的转人工是正常的。

置信度不能直接当作可信度

模型输出的概率或打分反映的是它对自己生成这段文字的确定程度,与内容是否属实不是一回事 —— 编造的内容也可以被高置信度地生成。把分数直接当成可信度阈值,会漏掉最危险的那类错误:自信且错误。

更可靠的替代是检索侧的信号:召回片段与问题的相关程度、是否有多个独立来源支持同一结论。这些是可以核对的。

抽检要常态化

  • 固定一份真实问题集,每次调整后重跑一遍,对比答案变化;
  • 线上答案按比例抽样人工复核,重点看有没有出现材料里不存在的说法;
  • 把发现的错误案例加进问题集,形成回归检查;
  • 高风险领域(价格、承诺、合规条款)设白名单或人工确认环节,不依赖模型自觉。

这几项合起来构成可运行的质量机制,具体落地可参考企业知识库解决方案与AI 智能体解决方案。

常见问题

怎么减少 AI 回答里的错误信息?

四件事配合:限定模型只依据检索到的材料作答、要求每个结论附带可点击的真实出处、明确允许回答不知道并转人工、以及对高风险内容设置人工确认环节。单靠换更强的模型通常收效有限。

模型给出的置信度能信吗?

不能直接当作内容可信度。置信度反映的是模型对生成这段文字的确定程度,编造的内容同样可能被高置信度地输出。更可靠的参考是检索侧信号,例如召回片段与问题的相关程度、是否有多个独立来源支持同一结论。

允许 AI 回答不知道会不会显得不专业?

比给出错误答案好得多。错误答案一旦被用户当真并据此行动,代价远高于一次转人工。实践中应当同时考核准确率与转人工率,并接受一定比例的转人工属于正常。

参考资料

  1. AI Risk Management Framework · NIST
  2. 生成式人工智能服务管理暂行办法 · 国家互联网信息办公室
# 幻觉# RAG# 提示词# AI 质量
免费咨询

聊聊你的项目

留下联系方式,我们一个工作日内联系你。先沟通需求和现状,再给方案;报价当面沟通。

  • 一个工作日内回复
  • 需求沟通免费,不强推方案
  • 交付管理后台与文档,可自行维护
仅用于本次咨询联系,不会用于其他用途。