特征归因

Parent: ai_keywords

特征归因(Feature Attribution)

核心定义

特征归因是可解释人工智能(XAI)的核心技术之一,指量化输入特征对模型预测结果的贡献程度,从而揭示“黑箱”模型的决策依据。其本质是建立从特征空间到输出空间的可解释映射,为每个特征分配一个重要性分数(如SHAP值、梯度权重或注意力权重),使得模型的高风险预测(如疾病诊断)能够被人类信任、审计或改进。


关键技术点

  1. 基于梯度的方法(Gradient-based)
    利用模型输出对输入特征的偏导数(如Saliency Map)或对其进行积分(如Integrated Gradients),计算特征敏感性。该方法计算高效,但易受梯度噪声影响,需配合平滑或路径积分策略。

  2. 基于扰动的方法(Perturbation-based)
    通过局部或全局扰动输入特征(如删除、替换或改变像素/变量),观察预测结果的变化。典型代表包括LIME(局部可解释模型)和SHAP(基于博弈论的Shapley值)。优点是与模型无关,但计算成本较高。

  3. 基于注意力机制的方法(Attention-based)
    在Transformer或视觉注意力网络中,直接使用注意力权重作为特征归因。虽然直观,但注意力权重可能不反映因果贡献,需后续验证(如Attention Rollout或Flow手段)。

  4. 基于代理模型的方法(Surrogate Model)
    用简单模型(如线性模型、决策树)局部拟合复杂模型的决策边界,提取特征重要性(如GUIDE、RuleFit)。特别适用于高维医学数据(如基因表达谱)的初步探索。


医学/神经科学应用场景

首都医科大学神经病学背景 – 脑卒中MRI病灶定位的归因解释
在基于深度学习的急性脑卒中检测模型中(输入为弥散加权成像DWI图像,输出为梗死核心区域概率),特征归因可逐像素量化模型识别病灶的关键影像学依据。例如,一个接受过训练的高精度U-Net在诊断左侧大脑中动脉区域梗死时,通过Integrated Gradients生成的显著性图显示:模型主要依赖病灶区的“高信号异常”(DWI受限区域),而对侧半球健康组织的归因分数趋近于零。这一解释不仅验证了模型与神经放射科医生的判读逻辑一致(高信号提示细胞毒性水肿),还能在假阳性病例中快速定位模型误判的伪影(如运动扰动灰质),为临床部署提供可追溯性安全屏障。此外,该归因结果可直接反馈至影像采集参数优化,提升多中心数据集的模型泛化能力。