降低 AI 幻觉不能只靠一句提示词,需要同时约束任务、提供可靠资料、允许模型承认不确定、验证输出,并把高风险决定留给有责任的人。
OpenAI 将幻觉解释为模型生成了看似合理但实际错误的陈述。2025 年发布的一项研究还指出,很多评估方式只奖励答对,不充分惩罚自信地答错,这会鼓励模型在不确定时猜答案。模型能力提高后,幻觉可以减少,但不能据此假设它已经消失。
先限制任务边界
任务越宽,模型需要自行补全的信息越多,出错空间也越大。与其要求“回答所有产品问题”,不如规定它只能根据已批准的资料回答某一类问题,并在资料不足时明确说不知道。
任务说明中应写清楚允许使用哪些信息,哪些问题必须拒答,什么情况需要转给人工。拒答不等于系统失败。在高风险场景中,承认不确定通常比给出一个流畅但错误的答案更有价值。
给答案提供可追溯依据
让模型检索指定知识库、数据库或实时工具,可以减少它只靠训练记忆回答的情况。回答中最好同时返回来源、文档日期或记录编号,方便使用者核对。
检索增强仍会出错。资料本身可能过期、互相矛盾,检索可能找错段落,模型也可能误读来源。因此,系统还要管理资料版本、访问权限和更新责任。
验证可以验证的部分
数字计算、日期格式、字段范围、引用链接和业务规则,尽量交给确定性程序检查。模型可以生成草稿,但程序负责验证结构和硬规则。
例如,系统可以要求输出固定字段,再检查必填项是否缺失;涉及金额时调用计算工具;引用制度时核对文档编号是否存在。验证失败后,不要让错误内容继续进入下一步流程。
按风险安排人工复核
内部头脑风暴和对外合同审查,不应使用同一套审核标准。输出的错误代价越高,人工复核、权限隔离和操作确认就越严格。
AI 可以帮助查找信息和形成初稿,但医疗、法律、财务、安全、人事等高风险决定仍需要具备相应责任和专业能力的人审核。人工复核也要有明确标准,不能只让审核人凭感觉扫一眼。
用真实任务持续测试
上线前准备一组真实问题,包含正常问题、资料缺失、冲突信息、越权请求和诱导性输入。上线后继续记录错误类型、拒答情况、来源质量和人工返工。
NIST 的生成式 AI 风险管理资料把“虚假但自信的内容”列为需要管理的风险之一,并强调测试、评估、验证和持续监测。一次测试通过,只能说明系统在当时那批样本上表现合格。
一份最低检查清单
- 任务范围是否明确?
- 模型是否只能访问获准的数据?
- 资料不足时是否允许拒答?
- 回答是否能追溯到来源?
- 数字、字段和规则是否有程序校验?
- 高风险输出是否必须人工确认?
- 错误是否会被记录并进入下一轮测试?
幻觉治理要减少错误、尽早发现错误,并阻止错误直接变成业务决定。任何“零错误”承诺都需要可靠证据支持。