LuAITools.com
提交工具
🔐AI
Differential Privacy

差分隐私

差分隐私通过往数据或输出里掺入可控的「噪声」,让人几乎无法反推出某个具体的人,是保护个体隐私的一套数学方法。

差分隐私是什么?

想象你要统计一个班级的平均工资,但没人愿意公开自己的数字。差分隐私的做法是:在结果里掺入一点点精心设计的「噪声」,让拿到结果的人,无法判断某个具体的人到底在不在数据里、具体数字是多少。「差分」这个词,指的就是比较两个「只差一个人」的数据集,看输出差异有多大——差异小到一定程度,单个个体就被藏起来了。它不是「把数据藏起来」,而是「让单个人的信息变得无法分辨」。

它为什么能做到「既公开又有隐私」?

噪声是可控的
加多少噪声,可以用数学精确计算。加得越多越安全,但数据也越不准,得在两者之间找平衡。
它给你一个「隐私预算」
每次查询都会消耗一点点隐私预算,超过一定限度就拒绝回答,防止有人反复追问、拼凑出真相。

它用在哪些地方?

苹果、谷歌等公司用它在收集用户打字习惯、浏览数据时保护个人隐私;人口普查也用类似思路发布统计结果。现在大模型训练也在用——让模型「见过数据」却「记不住具体某个人」。

它解决的核心问题

以前脱敏靠「删掉姓名、身份证号」这类笨办法,攻击者仍能靠「间接信息」把人认出来。差分隐私从数学上堵死了这条路:无论攻击者多聪明,都分不清你在不在里面。

一句话记住:差分隐私就是往数据里「加点料」,让统计结果可用,却让任何单个人都无从追查。

评论