公平度量学习
Parent: ai_keywords
公平度量学习(Fair Metric Learning)
核心定义
公平度量学习是机器学习中旨在通过优化嵌入空间中的距离函数或特征表示,使得模型对不同敏感属性组(如年龄、性别、种族)的个体产生无偏预测或相似对待的学习范式。其核心目标是在保持任务性能的同时,最小化跨敏感组的统计差异或个体级公平性损失,从而抑制算法歧视并增强模型在医疗等高敏感领域的伦理合规性。
关键技术点
- 对抗性去偏:引入对抗分类器,强制特征编码器难以从嵌入中预测敏感属性,从而剪切敏感信息与任务相关特征之间的依赖路径,实现隐式公平。
- 统计均衡约束:基于人口均势(Demographic Parity)或均衡机会(Equalized Odds)等准则,直接构造包含敏感组间错误率差异项的损失函数,通过拉格朗日对偶或惩罚项进行优化。
- 因果公平度量:借助结构因果模型(SCM)识别敏感属性与混淆变量间的因果路径,设计干预后度量,学习不受敏感属性直接或间接因果影响的可诊断表示。
- 度量对齐与校正:学习马氏距离矩阵,通过组间正负样本对约束,使不同敏感组在嵌入空间中具有相似的分布形态与类内紧致性,避免组间异方差引入的歧视。
- 联合优化与可解释性:将公平损失、任务损失与正则化项端到端联合训练,并通过注意力权重或类激活图提供跨组差异的可视化解释,便于临床验证。
医学/神经科学应用场景
以首都医科大学神经病学系对脑卒中预后的研究为背景:
在脑卒中后90天功能结局(mRS评分)预测中,不同年龄段、性别的患者存在显著的基线差异(如老年女性更常伴有心房颤动),可能导致深度学习模型对高龄女性低社会经济群体产生系统性低估。
采用公平度量学习框架,对结构化临床指标、CT灌注影像及EEG特征进行联合嵌入。以年龄(≥75岁 vs <75岁)和性别为敏感属性,在编码器后叠加对抗性分类器,强制其无法预测敏感属性;同时在度量层引入均衡机会约束,使模型在不同年龄组间对不良结局(mRS 3-6)的假阳性率差值≤5%。
在首都医科大学宣武医院850名脑卒中患者数据上,该方法在保持总体AUC(0.82)不降的前提下,将老年组与年轻组间的预测误差差异降低42%,显著减少了因年龄导致的不公平治疗分配风险,为临床决策支持系统的公平部署提供了可操作的算法基础。