交叉注意力

Parent: ai_keywords

交叉注意力(Cross-Attention)

核心定义

交叉注意力是一种基于查询-键-值(Query-Key-Value, QKV)机制的注意力变体,用于在两个不同的序列或模态之间建立动态关联。其核心在于:从源序列(如图像)生成 Query,从目标序列(如文本)生成 Key 和 Value,通过计算 Query 与 Key 的相似度权重,加权聚合目标序列的 Value,从而在不对等的数据来源间实现信息交互与特征对齐。

关键技术点

  1. QKV 异源计算:Query 和 Key-Value 分别来自不同输入空间(例如 Query 来自视觉编码器,Key-Value 来自语言编码器),打破了自注意力中单一序列的局限,使模型能够跨模态提取相关特征。
  2. 注意力权重矩阵:通过点积相似度计算(通常缩放后接 Softmax)得到注意力图,直观反映源序列每个元素对目标序列各元素的关注程度,具有可解释性。
  3. 上下文感知融合:交叉注意力允许在解码阶段动态选择目标序列中最相关的信息,常用于编码器-解码器架构(如 Transformer 中的编码器-解码器注意力层),实现序列到序列的精确映射。
  4. 计算高效变体:针对序列长度可能不对称的问题,发展了如稀疏交叉注意力(仅关注部分关键区域)、线性交叉注意力(降低二次复杂度)等优化策略,适配大规模多模态数据。
  5. 与自注意力的协同:在实际模型中,自注意力用于模态内全局依赖建模,交叉注意力用于模态间对齐,二者串联或并行(如多模态 Transformer)构成完整框架。

医学/神经科学应用场景

首都医科大学神经病学研究所在脑卒中预后预测中,应用交叉注意力融合颅脑 MRI 影像临床结构化数据(如 NIHSS 评分、发病时间)。具体地,MRI 编码器输出特征作为 Query,临床数据经嵌入后作为 Key-Value,通过交叉注意力层动态生成影像-临床跨模态表示,有效识别影像病灶位置与临床严重程度之间的非线性关联。该方法在 1200 例缺血性卒中队列中,将 90 天功能预后预测的 AUC 提升至 0.89,相比简单拼接策略提高 7.3%。此外,在帕金森病研究中,交叉注意力也被用于融合步态时序信号皮层脑电(ECoG),通过注意力图定位异常 β 波振荡与步态冻结的时空耦合关系,为闭环深部脑刺激(DBS)靶点优化提供新依据。