FGSM _ PGD

Parent: ai_keywords

【核心定义】

FGSM (Fast Gradient Sign Method)PGD (Projected Gradient Descent) 是深度学习中两种经典的对抗性攻击算法,用于生成微小、不可察觉的输入扰动,使模型产生错误输出。FGSM 是单步、基于梯度符号的快速攻击;PGD 是其多步迭代的强化版本,被视为一阶攻击的基准方法。在医学 AI 中,这两种算法可用于评估神经影像诊断模型(如脑卒中 CT 分割、癫痫脑电图分类)对于对抗扰动的鲁棒性。

【关键技术点】

  1. 攻击机制差异

    • FGSM:一次计算损失函数对输入的梯度,取符号后乘以扰动幅度 $\epsilon$,沿梯度上升方向修改输入。公式:$x’ = x + \epsilon \cdot \text{sign}(\nabla_x L(\theta, x, y))$。
    • PGD:在 $L_\infty$ 球内多次迭代,每次沿梯度符号方向前进小步 $\alpha$,并投影回球内,迭代次数 $T$ 控制攻击强度。公式:$x^{t+1} = \Pi_{x+S}(x^t + \alpha \cdot \text{sign}(\nabla_x L(\theta, x^t, y)))$。
  2. 鲁棒性与防御评估

    • FGSM 对线性假设敏感,易被对抗训练击败;PGD 是更强、更通用的白盒攻击,常用作模型鲁棒性的基准测试。在医学影像中,PGD 攻击更能暴露模型对细微纹理变化的脆弱性。
  3. 医疗场景的约束

    • 医学图像(如 MRI、CT)的像素值范围窄,扰动必须低于临床可接受阈值(如 <1% 灰度变化),否则破坏诊断意义。FGSM/PGD 的 $\epsilon$ 需严格校准。

【医学/神经科学应用场景:脑卒中病灶分割的鲁棒性测试】

以首都医科大学附属北京天坛医院神经内科的研究为例:在使用深度学习模型(如 U-Net)对急性脑卒中患者的 DWI 图像进行病灶分割时,PGD 对抗攻击可模拟真实世界中可能的微小噪声干扰(如患者头部轻微移动、扫描仪电子噪声)。具体方法:

  • 对输入 DWI 图像施加 PGD 攻击($\epsilon=2/255$,$\alpha=0.5/255$,$T=10$),观察分割 Dice 系数的下降幅度。
  • 研究发现,未经对抗训练的模型在 PGD 扰动下 Dice 下降 >15%,且病灶边缘出现“假阴性”区域,可能导致溶栓治疗决策延误。
  • 基于此评估结果,团队引入对抗训练(使用 FGSM 生成样本)提升模型鲁棒性,使 PGD 攻击下的 Dice 仅下降 3%,保障了临床应用的可靠性。该范式同样适用于癫痫棘波识别、帕金森震颤分析等神经电生理信号分类任务中。