编码器-解码器架构

Parent: ai_keywords

编码器-解码器架构

核心定义

编码器-解码器架构是深度学习领域解决序列到序列(seq2seq)映射问题的核心框架。编码器负责将输入序列(如文本、语音、脑电信号)编码为固定维度的上下文表示(Context Vector),解码器则基于该表示逐步生成目标输出序列。该架构突破了传统模型对输入输出固定长度的限制,是机器翻译、语音识别、图像描述等任务的基础范式。

关键技术点

  1. 注意力机制:克服长序列中上下文向量信息瓶颈。通过计算编码器各时序隐状态与解码器当前状态的匹配权重,动态聚焦输入关键部分,显著提升长距离依赖建模能力。
  2. 双向编码器:借鉴BERT思路,利用双向RNN或Transformer并行捕获上下文全局信息,避免单向编码丢失后向语义,尤其适合脑电信号等时序特征提取。
  3. 自回归解码与教师强制:解码器逐时间步生成输出,前一时刻预测作为当前输入(自回归)。训练时采用教师强制(用真实上一时刻代替预测),加速收敛,但需注意暴露偏差问题。
  4. 变分编码器(VAE)架构:在编码-解码间引入隐变量概率建模,实现生成式任务(如脑电数据增强)的连续潜空间表征,适用于医学中样本稀缺场景。
  5. Transformer 堆叠:取代递归结构,利用自注意力和交叉注意力实现并行计算,编码器-解码器模块级联构成现代主流方案(如T5、ChatGPT前身)。

医学/神经科学应用场景

癫痫发作预测(基于头皮/颅内脑电)
针对首都医科大学附属医院积累的长程脑电图数据,构建编码器-解码器模型:编码器(双向GRU或卷积Transformer)对高维时空EEG信号进行压缩和特征提取,学习发作间期与发作前期的动态模式;解码器(带有注意力机制的LSTM)以滑动窗口方式输出未来15–30分钟的发作概率序列。该框架同时输出预测不确定性估计,辅助临床预警系统决策。在疑难局灶性癫痫病例中,解码器还可并行生成发作起始区空间热图,实现“预测+定位”一体化,为术前评估提供非侵入性工具。