AIの「脱獄」って何?
「脱獄(Jailbreak)」はもともとスマホの制限を外すハッキングを指しました。AIの世界では、巧妙に作ったプロンプトでモデルの安全ガードレールをすり抜け、本来拒否すべきことを言わせる行為を指します。危険物の作り方や違法な助言、開示を禁じられた内容などです。「ハッキング」との違いは?
脱獄は通常、コードへの侵入もサーバーへの攻撃も必要ありません。「話す」だけで成立します。攻撃者が探すのはシステムの穴ではなく、モデルの「理解」の穴。ロールプレイや言い換え、段階的な誘導で、モデルに「ここは自由に話していい場面だ」と思い込ませます。よくある脱獄の手口
ロールプレイ「ルールのないAI」を演じさせて、危険な内容を引き出します。
物語化
有害な内容を「小説」「研究事例」に装って、NGワードを避けます。
段階的な誘導
無害な質問から始め、少しずつ話題を危険地帯へ導きます。
難読化
暗号や言葉遊び、翻訳などで本当の意図を隠します。
なぜ防ぎにくいのか
脱獄の本質は「言葉の柔軟さ」を突くこと。モデルは危険な聞き方を全て列挙することはできません。1つ塞いでも、攻撃者は別の聞き方をすぐ見つけます。これは終わりのない「いたちごっこ」で、安全チームがパッチを当て続け、脱獄者が新たな道を探し続けます。まとめ:AIの脱獄はシステム侵入ではなく「言葉巧みにモデルを騙す」こと。安全の壁を形骸化させる攻撃です。
コメント