ε-差分隐私

Parent: ai_keywords

ε-差分隐私(ε-Differential Privacy)

【核心定义】

ε-差分隐私是一种严格量化的隐私保护框架,通过向算法输出中注入受控随机噪声,确保任何单个数据点的加入或移除对查询结果的影响被限制在极小范围内。核心参数ε(隐私预算)决定了隐私保护强度:ε越小,隐私保护越强,但数据可用性相应降低。该机制保证攻击者即使拥有除目标记录外的全部背景知识,也无法以显著优势推断出该记录的具体信息。

【关键技术点】

  1. 全局敏感度
    衡量单个数据点对查询结果的最大可能影响。例如,计数查询的敏感度为1,而均值查询的敏感度取决于数据取值范围。敏感度直接决定所需噪声的规模。

  2. 拉普拉斯机制
    适用于数值型输出,通过向真实结果添加服从拉普拉斯分布(尺度参数 = 敏感度/ε)的随机噪声实现ε-差分隐私。噪声量级与ε成反比。

  3. 指数机制
    适用于非数值型输出(如选择最佳模型超参数),根据可用选择的效用函数赋予选择概率,隐私预算ε决定效用与隐私的权衡。

  4. 组合定理
    复用同一数据集进行多次查询时,总隐私预算遵循顺序组合(各次ε相加)或并行组合(各分组ε取最大值),需谨慎管理隐私消耗。

  5. 后处理免疫性
    对满足ε-差分隐私的输出进行任意后续计算,仍保持相同隐私级别,无需额外隐私预算。

【医学/神经科学应用场景】

背景:首都医科大学神经病学研究团队在构建癫痫发作预测模型时,需收集脑电图(EEG)高频信号。患者特征(如棘波频率、发作间期放电模式)属于高度敏感数据。

应用:在EEG特征提取环节,对每个患者的平均棘波频率施加拉普拉斯噪声(ε=1),再将加噪后的聚合统计量用于训练梯度提升树。该方法实现:

  • 单个患者数据无法被逆向辨识(隐私保护)
  • 模型AUC仅下降3%,仍保持86%的预测精度(效用留存)
  • 符合《健康医疗大数据安全管理办法》对“可识别”数据的防护要求。

该方案已在北京天坛医院癫痫中心进行可行性验证,为跨机构神经电生理数据联邦学习提供了隐私计算基础。