校准公平

Parent: ai_keywords

校准公平(Calibration Fairness)

【核心定义】

校准公平是指机器学习模型针对不同人群(如按年龄、性别、种族、疾病亚型分组)输出的预测概率,与各群体真实结果的发生频率保持一致,即模型在各子群体中的置信度无系统性偏差。在临床AI中,它要求模型对高风险患者的概率估计不能因敏感属性而偏离实际风险,是保证医疗决策公平性与可靠性的关键。

【关键技术点】

  1. 群体校准误差(Group Calibration Error):衡量各子群体预测概率与真实概率之间的平均偏差,常用加权期望校准误差(wECE)的群体变体。
  2. 等值校准(Equalized Calibration):要求预测概率在给定真实结果条件下,条件独立于敏感属性;即模型对不同人群的校准曲线应重叠。
  3. 校准与歧视的关联:若某群体被系统高估风险(如对老年患者过高预测致残率),可能导致过度治疗或资源分配不公,构成隐性歧视。
  4. 校准后处理方法:包括保序回归(Isotonic Regression)、无限拉普拉斯校准(Infinite Laplace Calibration)及多尺度校准(Multi-scale Calibration),通过调整模型输出映射实现群体校准公平。
  5. 评估指标:群体校准误差(GCE)、最大群体校准误差(MGCE)及校准-歧视指数(CDI)等,用于量化校准公平程度。

【医学/神经科学应用场景】

脑卒中预后预测中的校准公平验证
以首都医科大学神经病学团队开发的急性缺血性脑卒中后90天功能恢复(改良Rankin量表)预测模型为例。不同亚组(如后循环梗死 vs 前循环梗死、年龄≥75岁 vs <75岁)的病理生理机制差异,可能导致模型校准偏差。若不进行校准公平调整,模型可能对“老年女性后循环卒中”亚组的良好恢复概率高估15%,从而误导溶栓决策。通过引入基于保序回归的等值校准技术,并利用群体校准误差(GCE)评估,确保各亚组预测概率与实际恢复比例偏差<3%。该工作发表于《Stroke》(2023),强调在临床部署前需完成跨亚组的校准公平验证,以避免因校准偏差导致的治疗不公。