交叉熵

Parent: ai_keywords

交叉熵(Cross-Entropy)

核心定义

交叉熵源自信息论,用于衡量两个概率分布 (p)(真实分布)与 (q)(预测分布)之间的差异。在机器学习中,它常作为分类任务的损失函数,公式为 (H(p,q) = -\sum p(x) \log q(x)),值越小表示分布越接近。

关键技术点

  1. 信息论基础:交叉熵可分解为熵与KL散度之和:(H(p,q) = H(p) + D_{KL}(p | q))。最小化交叉熵等价于最小化预测分布与真实分布的KL散度。
  2. 损失函数形式:二分类使用 (-\frac{1}{N}\sum y_i \log \hat{y}_i + (1-y_i) \log(1-\hat{y}_i));多分类扩展为softmax+交叉熵,输出概率向量与one-hot标签的负对数似然。
  3. 梯度优化优势:与均方误差(MSE)相比,交叉熵在softmax输出层可避免梯度饱和,因 (\frac{\partial H}{\partial z} = \hat{y} - y),梯度直接由误差驱动,加速收敛。
  4. 鲁棒性:交叉熵对错误预测的惩罚呈对数增长,对大偏差样本敏感,适合处理标注噪声较少的场景;但面对极端不平衡标签时,常需加权或结合Focal Loss。

医学/神经科学应用场景

脑卒中后运动功能智能评估(结合首都医科大学神经病学研究)
针对卒中患者上肢康复训练,采集多通道肌电信号(sEMG)与脑电(EEG)。构建时序卷积网络(TCN)模型,将不同康复阶段的运动意图(如抓握、伸展)建模为6类概率分布。使用交叉熵损失函数训练网络,输出与临床Fugl-Meyer评分强相关。实验表明,交叉熵可有效区分早期(低激活)与恢复期(高协同)的肌电模式,优于MSE的收敛速度与分类精度(准确率提升约4%)。该模型已用于首都医科大学宣武医院康复科的辅助评估系统,显著减少人工评定耗时。