人工智能
提示词注入(Prompt Injection)
Prompt Injection
攻击者在输入或外部内容中夹带指令,诱导大模型违背原有规则的安全风险。
提示词注入是大模型应用特有的安全风险:攻击者把指令伪装成普通内容,混进模型读取的文本里,诱导模型忽略开发者设定的规则,例如泄露系统提示词、输出不当内容,或者调用本不该调用的工具。
它分为直接注入和间接注入两类。直接注入是用户在对话框里输入「忽略以上所有指令」之类的内容;间接注入更隐蔽,恶意指令藏在模型会读取的网页、文档、邮件或知识库条目中,用户本人可能完全不知情。
目前没有能彻底杜绝注入的单一办法,需要多层防护:把外部内容明确标记为数据而非指令;按最小权限原则给智能体分配工具;删除、付款、发送消息等敏感操作要求人工确认;对模型输出做校验和过滤;记录完整的调用日志以便追查。
企业在上线客服机器人、知识库问答或能执行操作的 AI 智能体前,应把注入测试纳入验收,用一批构造好的攻击样例检验系统表现,而不是只测试正常问题。上线后也应持续关注日志中的异常请求,及时补充防护规则。
免费咨询
聊聊你的项目
留下联系方式,我们一个工作日内联系你。先沟通需求和现状,再给方案;报价当面沟通。
- 一个工作日内回复
- 需求沟通免费,不强推方案
- 交付管理后台与文档,可自行维护