线性注意力
Parent: ai_keywords
线性注意力(Linear Attention)
【核心定义】
线性注意力是深度学习(尤其是Transformer架构)中用于替代标准缩放点积注意力(Softmax Attention)的高效机制。标准自注意力的计算复杂度为 O(n²)(n为序列长度),限制了其在长序列(如高密度电生理信号)中的应用。线性注意力通过将注意力计算中的相似度函数分解为可因子化的核函数(如线性点积或特征映射),将复杂度降至 O(n),使得模型能够在保持全局依赖捕获能力的同时,高效处理超长序列数据。
【关键技术点】
- 核方法近似:将Softmax中的指数相似度替换为可分解的核函数,例如使用随机特征映射(如Performer中的FAVOR+)或多项式核,将相似度矩阵拆分为子矩阵乘积,避免显式计算完整注意力矩阵。
- 累加因果掩码的线性化:在自回归任务(如神经信号流预测)中,通过前缀和(Prefix-Sum)技巧实现因果掩码下的线性化计算,无需显式构建下三角矩阵。
- 低秩分解:利用矩阵低秩性质(如Linformer),将注意力矩阵投影到较低维度的子空间,减少计算与内存开销。
- 稀疏与压缩策略:结合可学习稀疏模式或长短期记忆结构(如Linear Transformer),进一步降低冗余注意力权重对局部细粒度特征的稀释。
【医学/神经科学应用场景:癫痫发作的长程监测】
以首都医科大学神经病学研究团队的临床实践为背景,在癫痫患者的长程视频脑电图(EEG)监测中,信号常持续数小时至数天(如多通道EEG,采样率2561024 Hz,序列长度可达10⁵10⁶)。传统Transformer因O(n²)显存与算力需求无法实时分析。线性注意力机制可嵌入时间序列分类/异常检测模型,对EEG信号进行滑动窗口编码,同时捕获全局节律演化关系(如癫痫发作前1030秒的频谱渐变)与局部高频棘波形态。具体地,采用因果线性注意力实现流式处理:模型逐时间步更新状态,仅需线性累加即可提取发作前的特征(如弥散性δ节律增强、棘慢波复合体出现),并在发作前12秒生成警报,计算延迟控制在百毫秒级,从而在床旁设备上实现实时、低延迟的癫痫发作预警,极大提升重症监护环境下神经电生理监测的时效性与可靠性。