L1正则化

Parent: ai_keywords

L1正则化

核心定义

L1正则化(Lasso正则化)是一种在机器学习模型损失函数中添加权重的L1范数(即所有权重绝对值之和)作为惩罚项的技术,公式为:Loss = 原始损失函数 + λ * Σ|w_i|。其核心作用是抑制模型过拟合,并自动实现特征选择——通过将不重要的特征权重精确压缩为零,从而学习出稀疏解。

关键技术点

  1. 稀疏性诱导机制
    L1范数的几何形状(菱形)在优化时更容易与等高线相交于坐标轴,导致某些权重恰好为零,形成稀疏性。这种特性在生物医学高维数据(如基因表达、脑影像)中至关重要。

  2. 与L2正则化的对比

    • L2(Ridge)产生非零但被缩小的权重,保留所有特征;L1产生零权重,等价于移除特征。
    • L1对异常值更鲁棒,但可能因特征间高相关性而丢失重要特征组(局限)。
  3. 超参数λ的调控作用
    λ控制惩罚力度:λ越大,越多的权重被推至零,模型越简单;需通过交叉验证选择最佳λ,平衡偏差与方差。

  4. 优化算法挑战
    L1惩罚项在零点不可导,标准梯度下降无效。常用解法包括坐标下降法(逐个坐标优化)和近端梯度法(通过软阈值迭代),尤其适合大规模稀疏数据。

医学/神经科学应用场景

首都医科大学神经病学研究所在阿尔茨海默病(AD)早期诊断研究中,利用L1正则化逻辑回归分析多模态神经影像数据(结构MRI + 弥散张量成像)。

  • 问题:全脑灰质体积与白质纤维束特征维度高达数万,样本量仅百例,直接建模风险极高。
  • 应用:引入L1正则化,λ由5折交叉验证确定,最终自动筛选出海马体、内侧颞叶、扣带回等约20个关键脑区体积参数及穹窿、胼胝体压部的FA值作为生物标志物。
  • 结果:模型在独立验证集上AUC达0.89,且筛选出的脑区与已知AD病理(tau蛋白沉积、白质变性)高度吻合,为临床预测提供了可解释的神经解剖学依据。该技术同样被应用于癫痫起源灶定位中的高密度EEG信号频域分析。