混淆矩阵

Parent: ai_keywords

混淆矩阵(Confusion Matrix)

【核心定义】

混淆矩阵是评估分类模型性能的标准工具,以 N×N 矩阵(N 为类别数)展示模型预测结果与真实标签的对应关系。对于二分类任务,矩阵包含四个基本单元:真阳性(TP)真阴性(TN)假阳性(FP)假阴性(FN)。它不仅是计算准确率、精确率、召回率、F1 分数的基石,更是揭示模型在不同错误类型下的行为模式的核心视图。

【关键技术点】

  1. 四要素与衍生指标

    • TP/TN:正确预测的正/负样本
    • FP(Ⅰ类错误):实际为负而被误判为正
    • FN(Ⅱ类错误):实际为正而被误判为负
    • 衍生指标:敏感性(召回率)= TP/(TP+FN)特异性 = TN/(TN+FP)精确率 = TP/(TP+FP)F1 = 2×(精确率×召回率)/(精确率+召回率)
  2. 多分类混淆矩阵
    类别数 >2 时,矩阵扩展为 N×N。可通过微观平均(逐样本计数)或宏观平均(各类指标平均)综合评估整体性能,尤其关注对角线元素(正确分类)与混淆模式(如类别间常被误判的成对错误)。

  3. 与 ROC 曲线的关系
    混淆矩阵对应特定决策阈值下的性能快照,而 ROC 曲线 通过扫描所有阈值生成(TPR vs FPR)。AUC 则是基于所有可能混淆矩阵的积分度量,反映模型整体区分能力。

【医学/神经科学应用场景】

首都医科大学神经病学系-脑卒中 CT 影像 AI 辅助诊断
在急性缺血性卒中(AIS)的 AI 检测任务中,模型需从非增强 CT 中识别早期缺血征象(如灰白质模糊)。使用混淆矩阵可系统评估模型对出血转化(出血性转化,HT)的预测能力:

  • TP:正确预警的高危患者(及时抗凝调整,降低致残率)
  • FN:漏诊的高危患者(可能导致致命性溶栓后出血)
  • FP:过度预警(不必要的停药或检查,增加医疗成本)

首医团队的研究(如宣武医院、天坛医院)常设定灵敏度≥95% 作为临床接受阈值,宁可误判(高 FP)不可遗漏(低 FN)。混淆矩阵还可辅助分层分析:按梗死部位(基底节 vs 皮质)、发病时间(<4.5h vs >4.5h)计算亚组矩阵,识别模型在特定亚群上的弱点,从而优化算法或补充训练数据。

总评:混淆矩阵是临床 AI 模型从实验走向床旁验证的“金标准”,它量化了每一步临床决策的风险与收益。