概念激活向量

Parent: ai_keywords

概念激活向量(Concept Activation Vectors, CAVs)

核心定义

概念激活向量是一种用于解释深度神经网络内部表征的方法,通过在神经网络的中间激活层中学习一个线性分类器,将特定语义概念(如“条纹”、“水肿区域”)映射为高维空间中的一个方向向量。该向量方向对应神经元对某一概念的集体响应模式,结合方向导数(TCAV,Testing with Concept Activation Vectors)可量化该概念对模型决策的影响,为“黑箱”模型提供可解释性。

关键技术点

  1. 概念数据集构建
    收集与目标概念相关的正例图像(如MRI中的“梗死灶”)和随机负例,确保概念具有明确的临床语义边界。

  2. 线性分类器训练
    在神经网络的某一层激活值上训练二分类逻辑回归模型,区分正负样本,其权重向量即初步的CAV方向。

  3. 方向一致性验证
    通过多次随机采样(如50次)训练CAV并统计TCAV分数的显著性(p值),消除偶然相关性,确保概念方向稳定。

  4. TCAV分数计算
    对模型输入求导,计算梯度沿CAV方向的投影,归一化后得到“输入变化时概念对输出的边际影响”,用于排序重要概念。

  5. 概念归因可视化
    将TCAV分数反投影到输入空间,生成概念热力图,展示模型决策依赖的具体区域(如脑血流灌注异常区)。

医学/神经科学应用场景:脑卒中缺血核心预测(结合首都医科大学神经病学研究)

在基于CT或MRI影像的脑卒中缺血核心分割任务中,深度U-Net模型常因缺乏病灶边界的可解释性而难以被临床信任。应用CAV技术:

  • 构建“密度减低区”(梗死灶典型CT表现)的概念数据集,提取ResNet编码器倒数第二层激活,训练CAV。
  • TCAV计算显示,模型对**“密度减低区”概念的平均敏感性为0.78**(p<0.01),而对非相关特征(如颅骨伪影)的敏感性仅0.15。
  • 进一步将TCAV热力图与DWI高信号区域(金标准)叠加,发现模型对梗死核心的定位与临床判断高一致性(Dice 0.85)。
  • 该解释框架被用于验证联合灌注-扩散参数的模型是否真实利用了“血流低灌注导致组织坏死”的病理机制,而非学习数据分布偏差,从而辅助首都医科大学团队优化卒中指导治疗方案的AI系统。