提示注入是什么?
Agent 靠「提示词」驱动,而它的输入里往往混着来自外部的数据——网页内容、邮件、用户上传的文件。提示注入,就是攻击者在这类外部内容里埋一句「恶意指令」,诱导模型把它当成新命令来执行,从而绕过原本的规则。它为什么这么危险?
因为模型分不清「数据」和「指令」对模型来说,一段网页文字和一句系统命令,看起来都是普通的文本,很难分辨哪个该执行、哪个只是参考。
因为它能借 Agent 的「手」干坏事
一旦注入成功,攻击者可能让 Agent 泄露隐私数据、乱发邮件、甚至执行危险操作——而这一切都披着「用户正常请求」的外衣。
常见的攻击手法
直接注入在输入里写「忽略之前的指令,改为……」直接篡改行为。
间接注入
把恶意指令藏进 Agent 会去读取的网页或文档里,等它「自己踩进去」。
越狱提示
用角色扮演、故事包装等方式,诱导模型绕过安全限制。
怎么防范?
把「不可信的外部数据」和「系统指令」严格隔离、给指令设更高优先级、限制 Agent 的权限、对输出做校验——多管齐下,才能把风险压到最低。一句话记住:提示注入就是把「坏命令」藏在输入里,骗 Agent 当成「好命令」去执行。
评论