什么是提示词注入?为什么接了知识库也会中招?

直接答案

提示词注入是用恶意或误导性内容影响模型,让它忽略原有规则、泄露信息或执行不该执行的动作。攻击指令既可能来自用户输入,也可能藏在网页、文档和邮件等被检索资料中。

知识库并不会天然把内容变成可信指令。一个智能体读取外部网页或内部文件时,文档中可能包含“忽略之前要求”“把数据发到某处”等文字。如果系统没有区分资料和指令,模型可能把这些内容当成操作要求。

风险为什么会扩大

普通聊天机器人主要生成文字;连接邮件、数据库、文件系统或支付工具的智能体还能采取行动。权限越大,注入成功后的影响越严重。未经验证的模型输出如果直接进入代码、命令或网页,也可能触发后续漏洞。

常见防护方向

  • 把外部内容视为不可信数据,不允许它覆盖系统规则;
  • 限制工具和账号权限,敏感动作再次确认;
  • 校验模型输出,不把自由文本直接当代码或命令执行;
  • 记录工具调用和数据流,针对恶意样本测试;
  • 高风险流程保留人工批准和紧急停用能力。

没有单一过滤器能彻底解决提示词注入。有效防护依赖分层设计:即使模型判断错了,权限、校验和审批也应阻止它造成不可接受的后果。

万象云联编辑部 更新于 2026年8月12日

参考来源