差分プライバシーって何?
ある部屋の平均年収を知りたい、でも誰も自分の数字を教えたくない。差分プライバシーは、答えにわずかな「ノイズ」を混ぜます。それで結果を見た人は、特定の誰かがデータに含まれるか、その数字がいくらかを判断できなくなります。「差分」とは、たった1人だけ違う2つのデータセットを比べ、出力がどれだけ変わるかを見ること。その差を十分小さくすれば、個人は隠れます。データを隠すのではなく、「特定の個人の情報を判別できなくする」仕組みです。なぜ「公開しつつプライバシーを守る」のか
ノイズは調整できるどれだけノイズを足すかは数学で精密に計算できます。足すほど安全ですが、データはあいまいに。両者のバランスを取ります。
「プライバシー予算」がある
クエリのたびに予算を少しずつ消費し、上限を超えると回答を拒否します。何度も問い詰めて真実を組み立てるのを防ぎます。
どこで使われている?
AppleやGoogleは、入力の癖や閲覧データを学ぶときに個人を守るため使っています。国勢調査でも同じ考え方で統計を公開。いまは大規模モデルの学習にも使われ、モデルは「データを見ても、特定の個人を覚えない」ようになります。解決する核心課題
昔の匿名化は「名前とIDを消す」だけ。でも郵便番号や年齢、好きな映画などの間接情報から、攻撃者は人を特定できました。差分プライバシーは数学的にその道をふさぎます。攻撃者がどんなに賢くても、あなたが含まれるかはわからない。まとめ:差分プライバシーとは、データに「ひと工夫」加え、統計は使えるまま、誰一人として追跡できないようにする技術です。
コメント