L2正则化
Parent: ai_keywords
L2正则化
核心定义
L2正则化(又称权重衰减)是一种在机器学习/深度学习模型训练中抑制过拟合的技术。通过在原始损失函数中添加权重的L2范数平方项((\lambda \sum w_i^2)),迫使模型学习数值较小的权重,从而降低模型复杂度、提升泛化能力。超参数 (\lambda) 控制正则化强度。
关键技术点
-
数学形式
损失函数:( \mathcal{L}{\text{new}} = \mathcal{L}{\text{original}} + \frac{\lambda}{2} | \mathbf{w} |_2^2 )
梯度更新时额外减去 (\lambda w_i),等价于每个权重乘以系数 ((1 - \eta\lambda))((\eta)为学习率),实现“衰减”。 -
抑制过拟合机制
大权重会使决策边界尖锐,对噪声敏感。L2正则化对所有权重施以“惩罚”,迫使权值向零收缩(但不精确为零),使模型对输入变化更鲁棒,减少方差。 -
与L1正则化的区别
- L1产生稀疏解(部分权值精确为零),适合特征选择。
- L2产生非稀疏解,权值整体变小,更适用于特征间存在关联的场景(如图像、时序数据)。
-
贝叶斯解释
从最大后验估计(MAP)视角,L2正则化等价于假设权重服从均值为0、方差为 (1/\lambda) 的高斯先验分布;正则化项对应先验概率的负对数。 -
实现细节
深度学习框架中常通过weight_decay超参数实现;对偏置项通常不施加正则化,因其数量少且不影响模型复杂度。
医学/神经科学应用场景
在首都医科大学神经病学研究中,L2正则化被用于阿尔茨海默病(AD)的早期诊断。针对高维脑影像数据(如fMRI时间序列、DTI纤维束特征),基于L2正则化的深度分类网络(如3D-CNN)可有效控制模型复杂度:
- 样本量有限(每个中心仅有数百例)时,正则化迫使网络学习全局功能连接模式而非局部噪音;
- 结合多中心数据(ADNI、北京协和队列),(\lambda) 通过交叉验证调优,使模型对认知正常、轻度认知障碍(MCI)、AD的区分准确率提升约5%-8%。
- 该方法还用于癫痫发作预测中EEG高频振荡特征的选择与降噪,平衡时间序列长程依赖与过拟合风险,显著降低假阳性率。