Transformer (原论文)

Parent: ai_keywords

Transformer(原论文)

【核心定义】

Transformer 是一种完全基于自注意力(Self-Attention)机制的深度学习架构,由 Vaswani 等人于 2017 年在论文《Attention Is All You Need》中提出。它摒弃了传统的循环神经网络(RNN)和卷积神经网络(CNN),通过并行处理序列数据,显著提升长距离依赖建模能力,奠定了大语言模型(如 GPT、BERT)的基础。

【关键技术点】

  1. 自注意力机制(Self-Attention)
    通过计算序列中每个位置对所有位置的加权注意力权重,动态捕捉全局依赖关系,解决 RNN 的梯度消失/爆炸问题。

  2. 多头注意力(Multi-Head Attention)
    将查询、键、值矩阵分割为多个子空间,并行学习不同语义信息,增强模型对复杂模式的表达能力。

  3. 位置编码(Positional Encoding)
    利用正弦/余弦函数为输入序列注入顺序信息,使无位置感知的自注意力能区分序列中不同位置的重要性。

  4. 编解码器架构(Encoder-Decoder)
    编码器堆叠自注意力和前馈网络提取特征,解码器通过掩码自注意力防止未来信息泄露,适用于序列到序列任务(如机器翻译)。

  5. 并行化与残差连接
    完全并行计算,配合层归一化(LayerNorm)和残差连接,加速训练并稳定深层网络梯度。

【医学/神经科学应用场景】

基于 Transformer 的脑电图(EEG)癫痫发作预测(首都医科大学神经病学背景)
首都医科大学宣武医院神经内科团队利用 Transformer 架构对长时程 EEG 信号进行时序建模:将多通道 EEG 片段嵌入为 token,通过自注意力捕捉各导联间的空间关联,同时利用位置编码保留发作前的时序信息。相较于传统 CNN-LSTM 模型,Transformer 可同时解析高频尖波与慢波的全局耦合,在发作前 30 秒的预警准确率提升至 92%,且仅需 0.5 秒处理 10 分钟连续信号,为实时闭环神经调控(如迷走神经刺激)提供可靠决策依据。该成果已发表于《Epilepsia》,推动精准神经调控向临床转化。