差分隐私(Differential Privacy,DP)是2006年由Cynthia Dwork等人提出的数学化隐私保护框架,核心思想是:无论你的数据是否在数据集中,查询结果都不会发生可察觉的变化,从而保护个人隐私。
核心原理
- 在查询结果中加入经过校准的随机噪声(如拉普拉斯机制)
- 通过参数ε(隐私预算)控制隐私保护强度与数据可用性之间的平衡
- ε越小,隐私保护越强,但数据可用性越低
为什么重要
- 传统“去标识化”(如删除姓名)已被证明不足以保护隐私
- 差分隐私提供严格的数学保证,不依赖对攻击者能力的假设
- 与加密技术互补,适合统计发布和数据分析场景
实际应用
- 苹果在iOS设备上使用本地差分隐私收集使用统计
- Google等公司将其用于统计分析和大规模数据保护
- 各国统计部门将其用于人口、经济等敏感数据的发布
- 大模型训练中,差分隐私也被用于防止模型“记住”训练数据
挑战
噪声会降低数据质量,ε的选择是核心权衡;如何在实际系统中正确部署,仍是工程上的难点。