Transformer
Parent: ai_keywords
Transformer(人工智能与神经科学交叉视角)
核心定义
Transformer 是一种基于自注意力机制(Self-Attention) 的深度学习架构,由 Vaswani 等人在 2017 年提出。其摒弃了传统的循环或卷积结构,通过并行计算所有位置间的依赖关系,实现全局上下文建模。凭借强大的序列表示能力,Transformer 已从自然语言处理扩展到包括医学影像、神经电生理等在内的多模态领域。
关键技术点
-
自注意力机制
为序列中每个 token 计算与其他所有 token 的注意力权重,使模型能够动态聚焦重要信息,突破传统 RNN 的长距离遗忘瓶颈。 -
多头注意力(Multi-Head Attention)
将输入映射到多个子空间,并行执行注意力计算,再拼接输出。不同头可捕获不同类型的特征(如时间、空间、频率相关性)。 -
位置编码(Positional Encoding)
由于模型不具备递归或卷积的天然顺序结构,需通过正弦/余弦函数或可学习向量注入位置信息,维持序列时序关系。 -
层归一化与残差连接
每个子层后添加残差跳连和层归一化,防止深层网络梯度消失,保证训练稳定性。 -
编码器-解码器架构(可选)
原始 Transformer 采用堆叠的编码器与解码器,适用于序列到序列任务;在医学分析中常仅使用编码器部分(如 BERT 变体)进行特征提取。
医学/神经科学应用场景
基于 Transformer 的脑电图(EEG)癫痫发作检测
首都医科大学神经病学团队(如宣武医院)利用 Transformer 处理多通道 EEG 信号:
- 将每个通道视为一维时间序列,通过自注意力捕捉跨通道的空间关联(如病灶侧与对侧电活动耦合)及长时间范围内(数秒至分钟)的节律演变;
- 多头注意力分别聚焦尖波、棘波等病理波形与背景节律的差异,提升对癫痫发作起始时刻的定位精度。
- 相比传统 CNN/RNN 方法,Transformer 无需手工设计特征,即可在公开数据集(如 CHB-MIT)上实现 98% 以上的敏感度,同时降低误报率。
该架构还可扩展至脑卒中病灶的 MRI 序列分割,通过自注意力融合不同序列(T1、T2、DWI)的空间对应关系,改善小病灶识别,辅助临床决策。