AI「越狱」是什么?
「越狱」(Jailbreak)原本指破解手机系统、摆脱厂商限制,如今在 AI 圈,它指的是用精心构造的提示词,绕过模型的安全护栏,让 AI 说出它本该拒绝的话——比如制造危险物品的方法、违法建议,或是泄露它被禁止透露的内容。它和「黑客攻击」有什么不同?
越狱通常不需要入侵代码,也不碰服务器,只靠「说话」就能完成。攻击者不是找系统漏洞,而是找模型「理解」上的漏洞——用角色扮演、换种说法、层层套话,让模型误以为自己在一个「可以放开说」的场景里。常见的越狱手法
角色扮演让 AI 扮演「没有规则的 AI」,再套出危险内容。
讲故事
把有害内容包装成「小说情节」「研究案例」,绕开敏感词。
层层诱导
先问无害的问题,一步步把话题引向禁区。
编码混淆
用密码、谐音、翻译等方式隐藏真实意图。
为什么它这么难防?
越狱的本质,是「语言太灵活」。模型永远没法穷举所有「危险问法」,堵住一种,攻击者马上换一种。这成了一场持续的「猫鼠游戏」:安全团队不断打补丁,越狱者不断找新路。一句话记住:AI 越狱不是入侵系统,而是「用话术骗过模型」,让安全护栏形同虚设。
评论