L2正则化

Parent: ai_keywords

L2正则化

核心定义

L2正则化(又称权重衰减)是一种在机器学习/深度学习模型训练中抑制过拟合的技术。通过在原始损失函数中添加权重的L2范数平方项((\lambda \sum w_i^2)),迫使模型学习数值较小的权重,从而降低模型复杂度、提升泛化能力。超参数 (\lambda) 控制正则化强度。

关键技术点

  1. 数学形式
    损失函数:( \mathcal{L}{\text{new}} = \mathcal{L}{\text{original}} + \frac{\lambda}{2} | \mathbf{w} |_2^2 )
    梯度更新时额外减去 (\lambda w_i),等价于每个权重乘以系数 ((1 - \eta\lambda))((\eta)为学习率),实现“衰减”。

  2. 抑制过拟合机制
    大权重会使决策边界尖锐,对噪声敏感。L2正则化对所有权重施以“惩罚”,迫使权值向零收缩(但不精确为零),使模型对输入变化更鲁棒,减少方差。

  3. 与L1正则化的区别

    • L1产生稀疏解(部分权值精确为零),适合特征选择。
    • L2产生非稀疏解,权值整体变小,更适用于特征间存在关联的场景(如图像、时序数据)。
  4. 贝叶斯解释
    从最大后验估计(MAP)视角,L2正则化等价于假设权重服从均值为0、方差为 (1/\lambda) 的高斯先验分布;正则化项对应先验概率的负对数。

  5. 实现细节
    深度学习框架中常通过weight_decay超参数实现;对偏置项通常不施加正则化,因其数量少且不影响模型复杂度。

医学/神经科学应用场景

在首都医科大学神经病学研究中,L2正则化被用于阿尔茨海默病(AD)的早期诊断。针对高维脑影像数据(如fMRI时间序列、DTI纤维束特征),基于L2正则化的深度分类网络(如3D-CNN)可有效控制模型复杂度:

  • 样本量有限(每个中心仅有数百例)时,正则化迫使网络学习全局功能连接模式而非局部噪音;
  • 结合多中心数据(ADNI、北京协和队列),(\lambda) 通过交叉验证调优,使模型对认知正常、轻度认知障碍(MCI)、AD的区分准确率提升约5%-8%。
  • 该方法还用于癫痫发作预测中EEG高频振荡特征的选择与降噪,平衡时间序列长程依赖与过拟合风险,显著降低假阳性率。