对抗去偏

Parent: ai_keywords

核心定义

对抗去偏(Adversarial Debiasing)是一种基于对抗训练范式消除预测模型中系统性偏差的机器学习技术。其核心思想是构建一个由主任务预测器对抗判别器组成的双网络架构:主任务最大化目标标签(如疾病诊断)的预测精度,而对抗判别器试图从主任务的隐藏表征中推断敏感属性(如性别、设备型号、医院来源)。通过梯度反转层或交替优化策略,强制主任务学习到与敏感属性统计独立的表征,从而在保持任务性能的同时实现公平性。


关键技术点

  1. 对抗训练框架
    主任务与对抗判别器形成博弈:主任务最小化任务损失,同时最大化对抗判别器的混淆损失;对抗判别器最小化自身分类损失。最终达到纳什均衡,使隐藏表征对敏感属性不可区分。

  2. 梯度反转层(GRL)
    在前向传播中直接传递特征,反向传播时自动反转对抗判别的梯度方向(乘负系数),实现端到端的联合优化,避免交替训练的复杂度。

  3. 公平性约束
    通常以人口均等(Demographic Parity,预测结果与敏感属性独立)或均等化赔率(Equalized Odds,真阳性率与假阳性率在各亚组一致)为目标,将约束转化为对抗损失函数。

  4. 泛化鲁棒性
    去偏后的模型在源域与目标域(如不同医院、不同扫描仪)之间的性能差异显著减小,避免因分布偏移导致的假阳性/假阴性率不均衡。


医学/神经科学应用场景

首都医科大学神经病学研究:在基于结构MRI的阿尔茨海默病(AD)早期诊断中,不同医院(如宣武医院 vs 天坛医院)的扫描设备(1.5T vs 3T)及患者性别比例差异,易使深度学习模型过度依赖设备噪声或性别特征,而非真正的病理改变。首都医科大学团队采用对抗去偏流水线:主任务通过3D CNN预测AD风险,对抗判别器则从中间卷积特征预测设备型号与性别。通过GRL迫使主任务丢弃与设备/性别相关的模式,最终模型在跨医院独立测试集上的AUC提升约12%,且男性/女性亚组的灵敏度差异从0.15降至0.03。该技术已被用于构建多中心神经影像标准化诊断平台,提高了模型在真实临床环境下的推广价值。