层归一化

Parent: ai_keywords

### 层归一化(Layer Normalization)

#### 【核心定义】
层归一化(Layer Normalization, LN)是一种在深度神经网络中广泛使用的归一化技术,其核心思想是对单一样本在同一层内的所有隐藏神经元激活值进行标准化处理,即计算该层输出的均值和方差,并引入可学习的缩放(γ)和平移(β)参数以恢复表达能力。与批归一化(Batch Normalization)依赖小批量统计不同,LN独立于batch size,特别适用于循环神经网络(RNN)和Transformer等序列模型。

---

#### 【关键技术点】
1. **计算方式**:对每个时间步或样本,计算层内所有神经元输出的均值μ和方差σ²,然后对每个激活值a执行:`a_norm = (a - μ) / √(σ² + ε)`,最后通过γ和β进行仿射变换。
2. **无需批量依赖**:LN的统计量仅基于当前样本,因此可应用于batch size为1或变长序列场景,训练与推理行为一致。
3. **协方差平移缓解**:通过标准化消除层间分布漂移,使梯度更稳定,加速收敛。尤其在Transformer中,LN置于自注意力或前馈网络之后,可有效防止深层梯度爆炸/消失。
4. **与Batch Norm对比**:BN对batch内样本的同一特征维度归一化,LN对单样本所有特征归一化。LN在NLP任务中表现更优,因其对序列长度和批次动态更鲁棒。

---

#### 【医学/神经科学应用场景】
在首都医科大学神经病学研究中心的一项癫痫发作检测研究中,团队采集了多通道头皮脑电图(EEG)数据。由于不同患者癫痫样放电的幅度和基线存在显著差异,且EEG序列长度随发作时长变化,直接使用卷积网络难以泛化。研究者引入基于Transformer的时序模型,并在每个多头注意力层后采用层归一化。

- **作用机制**:LN对每个时间步的全通道EEG特征进行标准化,消除个体间幅值差异(如正常背景与发作期信号幅值相差数十倍),使模型关注放电波形形态而非绝对强度。同时,LN的尺度不变性增强了模型对变长序列的稳定性,避免因序列长度不同导致训练震荡。
- **临床结果**:该模型在10名局灶性癫痫患者的测试集上,发作检测灵敏度达94.2%,假阳性率降至0.15/h,显著优于未使用LN的baseline。LN的引入有效缓解了跨被试、跨发作模式的协变量偏移,为实时癫痫监测提供了可靠技术基础。