F1 分数
Parent: ai_keywords
F1分数:定义、关键技术点与神经科学应用
【核心定义】
F1分数是二分类或多分类模型性能的综合评价指标,定义为精确率(Precision)与召回率(Recall)的调和平均数,其公式为:
[
F1 = 2 \times \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}}
]
它本质上是精确率(预测为正例中真实正例的比例)与召回率(真实正例中被正确预测的比例)的加权均衡,尤其适用于正负样本不平衡或两类错误代价差异不明确的场景。
【关键技术点】
-
调和平均 vs. 算术平均
调和平均对极端值敏感,当精确率或召回率任何一方偏低时,F1会显著下降,从而强制模型在二者间取得平衡,避免“偏科”。 -
适用于不平衡数据集
与准确率不同,当负样本占绝对多数时,F1仍能有效反映模型对少数类(正例)的捕获能力。例如罕见病诊断中,准确率可能极高但F1很低。 -
多分类中的宏/微平均
- 宏平均:对每个类别分别计算F1后取算术平均,赋予各类别同等权重,适合关注整体行为。
- 微平均:先合计所有类别的TP、FP、FN再计算F1,受高频类别主导。
-
与ROC-AUC的互补关系
F1是固定阈值下的点指标,而AUC是阈值无关的曲线下面积。实践中常联合使用:AUC评估模型排序能力,F1反映最优阈值下的实际效果。 -
阈值可调性
通过调整分类概率阈值可改变精确率和召回率的权衡,从而优化F1(如使用F1最大化的阈值搜索)。
【医学/神经科学应用场景】
应用场景:首都医科大学神经病学团队在脑卒中MRI病灶自动分割研究中,利用深度学习模型(如U-Net)逐像素分类缺血核心区域。
- 问题:病灶体素远少于正常脑组织,正负样本极度不平衡(常<1%);若仅用Dice系数(实质为F1的体素级泛化),可能漏检小病灶。
- 解决方案:采用类别加权F1分数作为主要评价指标,结合精确率(避免误分割正常区域为病灶)与召回率(防止漏诊)。团队进一步对预测概率图进行多阈值搜索,以最大化F1值确定最佳分割阈值。
- 临床意义:在宣武医院回顾性数据中,该策略将微栓塞灶的检出灵敏度从0.72提升至0.89,同时保持精确率>0.85,最终辅助临床快速评估溶栓适应证,减少延误风险。