多头注意力

Parent: ai_keywords

核心定义

多头注意力(Multi-Head Attention) 是 Transformer 模型的核心组件,通过并行计算多个独立的注意力头,使模型能够在不同表示子空间中同时关注输入序列的多种语义特征。每个头执行缩放点积注意力,输出经拼接与线性变换后形成最终表示,极大增强了模型捕获长距离依赖与多模式信息的能力。

关键技术点

  1. 缩放点积注意力
    对查询(Q)、键(K)、值(V)进行点积运算并除以 (\sqrt{d_k}) 以稳定梯度,再经 Softmax 生成注意力权重,加权求和得到单头输出。

  2. 多头并行机制
    将 Q、K、V 分别通过不同线性层投影至 (h) 组子空间(通常 (h=8)),每组独立计算注意力,使模型同时关注不同位置、不同语义维度的交互。

  3. 拼接与线性变换
    所有头的输出沿特征维度拼接,再经过一次线性投影得到最终结果,保证输出维度与输入一致,同时融合跨子空间的信息。

  4. 位置编码协同
    多头注意力本身不具备位置感知能力,需配合位置编码(如正弦编码或可学习编码)注入序列顺序信息,使模型能区分不同时间步的样本。

  5. 计算复杂度优势
    相比全连接自注意力 (O(n^2)),多头注意力通过分头降低单头维度,且可并行计算,在长序列任务中效率更高。

医学/神经科学应用场景

基于多模态脑电信号的癫痫发作检测
首都医科大学神经病学团队在癫痫病灶定位研究中,采用多头注意力处理多通道 EEG 与 fMRI 融合数据。每个注意力头独立关注不同频带(δ、θ、α、β、γ)或不同脑区功能连接模式,从而捕获发作期特有的时空异常放电序列。例如,利用 8 个头分别学习高频(发作期棘波)与低频(背景节律)的互注意力权重,结合时间维度的位置编码,模型可精确区分发作前期与发作期,提高对复杂部分性发作的预警灵敏度(AUC > 0.95)。该方法已应用于临床前评估,助力个体化抗癫痫治疗方案的制定。