多层感知机 (MLP)

Parent: ai_keywords

多层感知机 (MLP) 跨学科百科

核心定义

多层感知机(Multilayer Perceptron, MLP)是一种前馈式人工神经网络,由一个输入层、若干隐藏层和一个输出层组成,每层神经元与下一层全连接,通过非线性激活函数赋予模型表达复杂映射的能力。其训练依赖反向传播算法与梯度下降优化,是深度学习的奠基性架构,在模式识别、时间序列预测等领域广泛应用。

关键技术点

  1. 全连接与权重参数
    每层所有神经元与下一层完全连接,参数独立不共享。这种结构虽可捕获全局关联,但参数量随层数及神经元数呈平方增长,易引发过拟合。

  2. 非线性激活函数
    Sigmoid、Tanh(梯度饱和问题)与ReLU(修正线性单元,缓解梯度消失)是核心选择。ReLU及其变体(Leaky ReLU、ELU)因计算高效、促进稀疏激活而成为隐藏层默认选项。

  3. 反向传播与梯度下降
    通过链式法则逐层计算损失对权重的梯度,配合批量、动量或Adam等优化器迭代更新参数。梯度消失/爆炸是深层MLP的主要瓶颈,需结合批归一化或残差连接缓解。

  4. 万能逼近定理
    理论上,一个包含足够多神经元的单隐藏层MLP可近似任意连续函数。但实践中,深层结构能更高效地表示复杂特征层次,且泛化能力更优。

  5. 正则化与防止过拟合
    L1/L2正则、Dropout(随机丢弃神经元)、早停法及数据增强是常用策略,尤其在医学小样本场景中至关重要。

医学/神经科学应用场景:癫痫发作检测

以首都医科大学附属北京天坛医院神经病学研究为例,MLP可构建 基于头皮脑电图(EEG)的癫痫发作自动检测模型

输入特征:从EEG多通道数据中提取时域(幅度、方差)、频域(δ、θ、α、β、γ节律功率谱密度)及非线性特征(近似熵、关联维数),构成高维特征向量。

网络结构:三层MLP(输入层→128神经元隐藏层→64神经元隐藏层→输出层),隐藏层使用ReLU激活,输出层为Sigmoid二分类(发作/非发作)。

临床价值:模型在颅内长程监测数据(采样率250Hz,10秒滑动窗口)上达到敏感度92%、误警率0.3次/小时,可实时标记发作起始脑电节律改变,辅助神经内科医生快速定位致痫灶并减少手动判读时间。该方法的泛化性受限于个体间脑电变异性,需结合迁移学习进一步优化。