敵対的サンプルって何?
敵対的サンプル(Adversarial Example)は、AIを騙すためにわざと加工された入力です。定番の例はパンダの写真。ほとんど見えないノイズを少し足すと、人にはパンダのままでも、AIは自信たっぷりに「テナガザル」と答えます。入力のわずかな違いで、モデルの判断がひっくり返るのです。なぜAIが騙されるのか
AIはピクセルの中から特徴を探して画像を認識します。その特徴は、人が見る「輪郭や色」とは別物。攻撃者はモデルの「弱点」に沿ってピクセルを微調整し、間違った特徴に過剰な自信を持たせます。その結果が、あり得ない答え。モデルの判断がいかに脆いかの証明でもあります。敵対的サンプルはどこに現れるか
画像認識自動運転が「一時停止」を「速度制限」と読み違える——現実では命に関わります。
音声認識
人の耳に聞こえない命令を音声に仕込み、音声アシスタントに実行させます。
テキスト
特定の言い回しや文字で、モデルに誤った・有害な出力をさせます。
なぜ重要なのか
敵対的サンプルが示すのは、AIの能力と信頼性は別物だということ。テストで99%正解するモデルも、1%の「賢いノイズ」にあっさり負けます。研究はAIの強化に役立つと同時に、自動運転・医療・セキュリティにAIを入れる前にリスクを考える材料になります。まとめ:敵対的サンプルは「AIへの睡眠薬」。人には見分けがつかなくても、AIはそれで完全に間違えます。
コメント