混淆矩阵
Parent: ai_keywords
混淆矩阵(Confusion Matrix)
【核心定义】
混淆矩阵是评估分类模型性能的标准工具,以 N×N 矩阵(N 为类别数)展示模型预测结果与真实标签的对应关系。对于二分类任务,矩阵包含四个基本单元:真阳性(TP)、真阴性(TN)、假阳性(FP) 和 假阴性(FN)。它不仅是计算准确率、精确率、召回率、F1 分数的基石,更是揭示模型在不同错误类型下的行为模式的核心视图。
【关键技术点】
-
四要素与衍生指标
- TP/TN:正确预测的正/负样本
- FP(Ⅰ类错误):实际为负而被误判为正
- FN(Ⅱ类错误):实际为正而被误判为负
- 衍生指标:敏感性(召回率)= TP/(TP+FN),特异性 = TN/(TN+FP),精确率 = TP/(TP+FP),F1 = 2×(精确率×召回率)/(精确率+召回率)。
-
多分类混淆矩阵
类别数 >2 时,矩阵扩展为 N×N。可通过微观平均(逐样本计数)或宏观平均(各类指标平均)综合评估整体性能,尤其关注对角线元素(正确分类)与混淆模式(如类别间常被误判的成对错误)。 -
与 ROC 曲线的关系
混淆矩阵对应特定决策阈值下的性能快照,而 ROC 曲线 通过扫描所有阈值生成(TPR vs FPR)。AUC 则是基于所有可能混淆矩阵的积分度量,反映模型整体区分能力。
【医学/神经科学应用场景】
首都医科大学神经病学系-脑卒中 CT 影像 AI 辅助诊断
在急性缺血性卒中(AIS)的 AI 检测任务中,模型需从非增强 CT 中识别早期缺血征象(如灰白质模糊)。使用混淆矩阵可系统评估模型对出血转化(出血性转化,HT)的预测能力:
- TP:正确预警的高危患者(及时抗凝调整,降低致残率)
- FN:漏诊的高危患者(可能导致致命性溶栓后出血)
- FP:过度预警(不必要的停药或检查,增加医疗成本)
首医团队的研究(如宣武医院、天坛医院)常设定灵敏度≥95% 作为临床接受阈值,宁可误判(高 FP)不可遗漏(低 FN)。混淆矩阵还可辅助分层分析:按梗死部位(基底节 vs 皮质)、发病时间(<4.5h vs >4.5h)计算亚组矩阵,识别模型在特定亚群上的弱点,从而优化算法或补充训练数据。
总评:混淆矩阵是临床 AI 模型从实验走向床旁验证的“金标准”,它量化了每一步临床决策的风险与收益。