对数损失

Parent: ai_keywords

对数损失(Log Loss)

核心定义

对数损失(Log Loss),又称逻辑损失或交叉熵损失,是监督学习中用于评估分类模型输出概率质量的核心指标。它衡量模型预测的概率分布 (p) 与真实标签 (y)(通常为0或1)之间的差异,基于负对数似然原理。数学上,对于二分类:
[ L = -\frac{1}{N}\sum_{i=1}^{N} \left[ y_i \log(p_i) + (1-y_i) \log(1-p_i) \right] ]
值越小,表明预测概率越接近真实分布,模型性能越优。


关键技术点

  1. 交叉熵等价性:对数损失本质是二分类交叉熵,在多分类中推广为分类交叉熵,直接对应概率分布的相对熵(KL散度)的简化形式。
  2. 概率校准敏感性:对预测概率的置信度高度敏感——错误样本若输出极端概率(如预测概率0.99却实际为负类),将产生巨额惩罚,这迫使模型输出校准良好的概率。
  3. 梯度优化特性:其梯度形式为 (\nabla = p - y),与线性模型的残差形式一致,便于梯度下降;且非凸性在逻辑回归中消失(对数似然为凸函数),确保全局最优。
  4. 不平衡数据适用性:通过加权版本(如类别权重)可缓解类别不平衡问题,但原始形式对正负类差异敏感。
  5. 与准确率的区别:准确率忽略概率细粒度信息,而对数损失能捕捉“接近正确但概率不足”的细微差异,尤其在概率阈值决策场景中更关键。

医学/神经科学应用场景

首都医科大学神经病学背景:脑卒中预后预测模型
在急性缺血性卒中患者中,利用多模态影像(如DWI、CTP)和临床参数(如NIHSS评分、发病至再通时间)构建90天功能预后(改良Rankin量表≥3 vs. 0-2)的二分类预测模型。模型输出每个患者的良好预后概率 (p),使用对数损失作为训练与验证的核心指标。

  • 临床意义:对数损失不仅惩罚错误分类,更精准惩罚过自信的错误预测(如对预后良好患者预测概率0.01),这直接对应临床决策容错需求——误判一个高风险患者为低风险可能导致延误血管内治疗。
  • 研究价值:在首都医科大学附属北京天坛医院的大型队列中,通过对数损失对比不同模型(如逻辑回归、深度神经网络)的概率校准能力,发现校准后的模型对数损失降低约15%,显著提升了临床决策支持工具的可靠性。
  • 扩展:该方法同样适用于癫痫发作期预测、帕金森病运动波动识别等概率敏感型任务,确保模型在信噪比低的脑电数据中输出稳健的预警概率。