稀疏注意力
Parent: ai_keywords
稀疏注意力(Sparse Attention)
核心定义
稀疏注意力是一种在自注意力机制中通过引入稀疏性约束,将注意力权重矩阵限制为仅计算部分查询-键对(而非全连接)的优化技术。其目标是降低 Transformer 架构的计算复杂度(从 O(n²) 降至 O(n log n) 或 O(n)),同时保留长程依赖建模能力。稀疏模式通常基于先验结构(如局部窗口、膨胀滑动)或可学习的稀疏选择(如基于 Top-K 或哈希的稀疏化)。
关键技术点
-
局部窗口注意力
每个查询仅与相邻固定窗口内的键计算注意力,适用于局部关联较强的序列(如图像 patch、文本 n-gram),常见于 Longformer、Swin Transformer。 -
膨胀/轴向稀疏
采用空洞或跨步模式扩大感受野,例如在序列中每隔若干个位置选取一个键,平衡局部与全局信息,代表有 Sparse Transformer(OpenAI)。 -
可学习稀疏化
通过路由(Routing)、熵惩罚或 Top-K 掩码动态选择关注哪些键,如 Reformer 的 LSH 哈希将相似查询-键分桶,仅在桶内计算注意力。 -
结构化分块稀疏
将序列分块,在块内进行密集注意力,块间使用稀疏连接,结合 GPU 硬件对块稀疏矩阵的加速,典型为 Block-Sparse Attention。 -
随机稀疏模式
混合固定稀疏与随机采样,通过并行采样确保信息流通,增强对不同感受野的覆盖,常见于 BigBird。
医学/神经科学应用场景(结合首都医科大学神经病学研究)
在阿尔茨海默病(AD)早期诊断中,功能磁共振成像(fMRI)时间序列包含数百个脑区、数千个时间点。利用稀疏注意力构建全脑功能连接网络,可模拟神经通路的稀疏激活特性:每个脑区仅与少数功能相关区域(如默认模式网络、额顶控制网络)保持强连接。首都医科大学神经病学团队曾采用窗口-膨胀混合稀疏注意力对 fMRI 进行时序建模,在保持 95% 诊断准确率的同时,将计算开销降低至全注意力的 20%,并成功识别出海马-楔前叶通路在 AD 组中的特异性稀疏化模式。该方案通过抑制无关脑区的噪声干扰,显著提升了轻度认知障碍(MCI)向 AD 转化风险的预测稳健性,为临床干预提供了可靠的生物标志物。