人口统计学平等
Parent: ai_keywords
核心定义
人口统计学平等(Demographic Parity)在人工智能与医学交叉领域中,指AI系统在预测、诊断或预后评估时,其输出结果(如疾病风险概率、治疗建议)不应与受保护的人群属性(如年龄、性别、种族、社会经济地位、地域)存在系统性关联。其核心要求是:算法模型对不同人口学亚组的假阳性率、假阴性率、阳性预测值等关键绩效指标应实现统计无偏,避免强化或新生医疗不公。
关键技术点
-
数据平衡与重加权:通过过采样、欠采样或生成对抗网络(GAN)合成缺失群体样本,消除训练集中因人口分布不均导致的特征偏移。例如在神经电生理数据集中,确保不同性别、年龄组的癫痫发作期/间期样本比例均衡。
-
公平性约束的学习算法:在模型优化目标中引入正则化项(如对抗性去偏、拉格朗日乘子),强制模型对敏感属性(如种族)的预测结果互信息最小化。例如在帕金森病步态分析中,控制模型对不同性别患者的震颤识别准确率差异≤1%。
-
跨群体校准评估:使用相等机会(Equal Opportunity) 和人口均等(Demographic Parity) 指标,分别检验敏感属性各组间的真阳性率(TPR)与阳性预测值(PPV)是否一致。常用混淆矩阵分解(如CAML)定位特定亚组偏差来源。
-
联邦学习与隐私保护:在多中心协作(如首医大联盟医院)中,采用差分隐私或同态加密,在保护患者人口信息的前提下联合训练全局公平模型,避免局部数据分布差异放大不平等。
医学/神经科学应用场景(首都医科大学神经病学背景)
以脑卒中早期预警模型为例:首医大附属医院收集的CT/MRI影像及电子病历数据中,老年、低收入或农村患者样本往往偏少。若直接训练深度学习预测模型,可能对城市中产阶级年轻群体(样本多)过拟合,导致对农村老年女性患者的卒中风险低估(假阴性率上升)。解决方案:1)采用人口统计学加权损失函数,对少数群体样本赋予更高权重;2)引入公平性审计层,在模型部署前用首医大特色数据库(覆盖京郊及贫困地区)验证,确保不同年龄、医保类型亚组的AUC差异<0.03;3)联合神经电生理特征(如EEG慢波比率),在因果推断框架中分离疾病生物标志与人口混杂因素,最终实现《健康中国2030》要求的“城乡卒中防控资源均等化”。