什么是提示词注入?为什么接了知识库也会中招?
直接答案
提示词注入是用恶意或误导性内容影响模型,让它忽略原有规则、泄露信息或执行不该执行的动作。攻击指令既可能来自用户输入,也可能藏在网页、文档和邮件等被检索资料中。
知识库并不会天然把内容变成可信指令。一个智能体读取外部网页或内部文件时,文档中可能包含“忽略之前要求”“把数据发到某处”等文字。如果系统没有区分资料和指令,模型可能把这些内容当成操作要求。
风险为什么会扩大
普通聊天机器人主要生成文字;连接邮件、数据库、文件系统或支付工具的智能体还能采取行动。权限越大,注入成功后的影响越严重。未经验证的模型输出如果直接进入代码、命令或网页,也可能触发后续漏洞。
常见防护方向
- 把外部内容视为不可信数据,不允许它覆盖系统规则;
- 限制工具和账号权限,敏感动作再次确认;
- 校验模型输出,不把自由文本直接当代码或命令执行;
- 记录工具调用和数据流,针对恶意样本测试;
- 高风险流程保留人工批准和紧急停用能力。
没有单一过滤器能彻底解决提示词注入。有效防护依赖分层设计:即使模型判断错了,权限、校验和审批也应阻止它造成不可接受的后果。
参考来源
- OWASP Top 10 for Large Language Model Applications OWASP Foundation