F1 分数

Parent: ai_keywords

F1分数:定义、关键技术点与神经科学应用

【核心定义】

F1分数是二分类或多分类模型性能的综合评价指标,定义为精确率(Precision)与召回率(Recall)的调和平均数,其公式为:
[ F1 = 2 \times \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}} ]
它本质上是精确率(预测为正例中真实正例的比例)与召回率(真实正例中被正确预测的比例)的加权均衡,尤其适用于正负样本不平衡或两类错误代价差异不明确的场景。


【关键技术点】

  1. 调和平均 vs. 算术平均
    调和平均对极端值敏感,当精确率或召回率任何一方偏低时,F1会显著下降,从而强制模型在二者间取得平衡,避免“偏科”。

  2. 适用于不平衡数据集
    与准确率不同,当负样本占绝对多数时,F1仍能有效反映模型对少数类(正例)的捕获能力。例如罕见病诊断中,准确率可能极高但F1很低。

  3. 多分类中的宏/微平均

    • 宏平均:对每个类别分别计算F1后取算术平均,赋予各类别同等权重,适合关注整体行为。
    • 微平均:先合计所有类别的TP、FP、FN再计算F1,受高频类别主导。
  4. 与ROC-AUC的互补关系
    F1是固定阈值下的点指标,而AUC是阈值无关的曲线下面积。实践中常联合使用:AUC评估模型排序能力,F1反映最优阈值下的实际效果。

  5. 阈值可调性
    通过调整分类概率阈值可改变精确率和召回率的权衡,从而优化F1(如使用F1最大化的阈值搜索)。


【医学/神经科学应用场景】

应用场景:首都医科大学神经病学团队在脑卒中MRI病灶自动分割研究中,利用深度学习模型(如U-Net)逐像素分类缺血核心区域。

  • 问题:病灶体素远少于正常脑组织,正负样本极度不平衡(常<1%);若仅用Dice系数(实质为F1的体素级泛化),可能漏检小病灶。
  • 解决方案:采用类别加权F1分数作为主要评价指标,结合精确率(避免误分割正常区域为病灶)与召回率(防止漏诊)。团队进一步对预测概率图进行多阈值搜索,以最大化F1值确定最佳分割阈值。
  • 临床意义:在宣武医院回顾性数据中,该策略将微栓塞灶的检出灵敏度从0.72提升至0.89,同时保持精确率>0.85,最终辅助临床快速评估溶栓适应证,减少延误风险。