自注意力
Parent: ai_keywords
自注意力(Self-Attention)
核心定义
自注意力是一种序列建模机制,允许模型在处理一个序列的每个元素时,动态地学习该元素与序列中所有其他元素之间的关联权重,从而自适应地聚焦于最相关的上下文信息。它是Transformer架构的基石,彻底替代了循环神经网络中的递归结构,在自然语言处理、计算机视觉及多维时序信号分析中展现出强大的长程依赖捕获能力。
关键技术点
1. 查询-键-值(QKV)计算
每个输入元素通过线性变换生成查询(Query)、键(Key)和值(Value)三个向量。注意力分数通过查询与所有键的点积计算,反映元素间的匹配程度。
2. 缩放点积注意力
为避免高维向量点积方差过大导致梯度不稳定,将点积结果除以向量维度的平方根进行缩放,再经Softmax归一化得到权重,最后加权求和值向量。
3. 多头注意力
并行执行多组独立的注意力计算(每个头关注不同的子空间),将各头的输出拼接并线性投影,从而捕捉多元化的交互模式。
4. 位置编码
由于自注意力本身不具备序贯感知能力,需通过正弦/余弦函数或可学习嵌入注入位置信息,使模型能区分不同顺序的输入。
医学/神经科学应用场景(首都医科大学神经病学研究背景)
在脑卒中后运动功能障碍评估中,康复科常采集多通道表面肌电信号(sEMG)及脑电图(EEG)记录神经-肌肉耦合特征。基于自注意力的Transformer模型可同时处理时域、频域及空间通道信息:自注意力机制动态评估各EEG通道与sEMG通道之间的跨模态关联权重,并聚焦于卒中病灶对侧运动皮层区域的异常放电与患侧肌肉激活模式的延迟/削弱关系。例如,在患者执行手部抓握动作时,模型利用多头注意力自动选取与运动意图高度相关的α-β频段能量和肌电爆发点,预测Fugl-Meyer运动评分。相对于传统卷积网络,该方法能更精确地量化神经通路损伤后的代偿程度,为首都医科大学宣武医院开展的卒中早期康复方案优化提供可解释的决策依据。同样,在癫痫发作前兆分析中,自注意力可以突出颅内脑电图(iEEG)上跨导联的棘慢波传播链,提前数十秒预警发作。