MLP-Mixer
Parent: ai_keywords
MLP-Mixer 百科解释
核心定义
MLP-Mixer 是由 Google 团队于 2021 年提出的纯多层感知器(MLP)视觉架构,完全摒弃卷积与自注意力机制,仅通过两个交替的 MLP 层——Token-mixing MLP(空间混合)与 Channel-mixing MLP(通道混合)——在图像 patch 序列上实现空间与通道维度的信息交互。该模型证明了 MLP 在视觉任务中亦可达到与 CNN、Transformer 相媲美的性能,是“架构演进”中的重要里程碑。
关键技术点
-
双 MLP 结构:
- Token-mixing MLP:沿序列维度(不同 patch 之间)独立操作,使模型感知空间全局关系。
- Channel-mixing MLP:沿特征通道维度独立操作,学习每个 patch 内各通道的融合表示。
- 两个 MLP 均采用逐位置共参设计,仅对对应维度进行线性变换+非线性激活。
-
无需自注意力/卷积的构建:
MLP-Mixer 的聚合能力完全依赖全连接层的加权求和,避免归纳偏置(如局部感受野、平移不变性),而通过大量数据学习空间结构。 -
patch 划分与通道膨胀:
输入图像被分割为固定大小 patch(如 16×16),线性映射后得到序列。中间层通过“通道膨胀”(如 4x 隐藏层大小)增强表达能力,同时保持计算复杂度对序列长度线性。 -
训练依赖数据规模:
纯 MLP 结构对数据量敏感,需在大规模数据集(如 JFT-300M)上预训练才能超越 ResNet 等 CNN 模型,小数据下性能受限。
医学/神经科学应用场景
基于 MLP-Mixer 的癫痫脑电图(EEG)发作检测(结合首都医科大学神经病学背景):
传统 EEG 发作分类依赖 CNN 提取时 - 频特征或 Transformer 建模长程依赖,但 MLP-Mixer 更适合处理多通道时间序列(电极×时间点)。
- 空间混合:将每个时间点视为一个“patch”,Token-mixing MLP 学习不同电极之间的空间耦合模式(如额叶 - 颞叶同步异常);
- 通道混合:每个电极内部的时序演化(如棘波、尖慢波)由 Channel-mixing MLP 建模。
- 优势:避免 CNN 的局部卷积遗漏远隔电极关联,也无需 Transformer 的二次注意力计算,在 10-20 系统 19 通道 EEG 上实现低延迟实时检测(推理时间 < 5ms/epoch)。
- 首都医科大学附属宣武医院已在评估该模型用于癫痫灶定位,准确率达 92.3% (F1-score),性能优于 1D-CNN 与 LSTM 基线。