对抗样本
Parent: ai_keywords
对抗样本(Adversarial Examples)
【核心定义】
对抗样本是指通过对原始输入数据施加人眼(或人类感知)无法察觉的微小扰动,而使得机器学习模型(尤其是深度学习模型)以高置信度输出错误预测的样本。这一现象揭示了当前神经网络在决策边界上的脆弱性,即在数据流形局部存在可被定向利用的“盲点”。
【关键技术点】
-
扰动不可感知性
对抗扰动通常受限于一个很小的范数(如L∞≤ε),确保人肉眼看不出图像变化,或听不出语音差异,但足以使模型分类完全翻转(如将“熊猫”误判为“长臂猿”)。 -
白盒与黑盒攻击
- 白盒:攻击者知悉模型架构与参数,利用梯度上升(如FGSM、PGD)快速生成对抗样本。
- 黑盒:仅通过模型输入输出查询,利用迁移性(即针对某模型的对抗样本常能欺骗另一模型)或基于零点梯度估计方法(如ZOO)进行攻击。
-
对抗训练
主流的防御手段,在训练过程中主动加入对抗样本,使模型学习到更鲁棒的决策边界。但存在计算成本高、对强攻击泛化不足等问题。 -
迁移性与通用对抗扰动
对抗样本可在不同架构间迁移,催生了“通用对抗扰动”(UAP, Universal Adversarial Perturbation),即单张扰动可使多数样本被误分类,这对医学影像AI的安全部署构成重大挑战。
【医学/神经科学应用场景】
场景:脑电图(EEG)癫痫发作检测模型的安全性评估
首都医科大学神经病学系基于深度学习的EEG自动分析系统,用于辅助诊断癫痫发作。研究团队发现,对输入EEG信号施加经过精心设计的、幅值低于生理噪声水平的高频扰动(L∞≤0.01 mV),可诱使分类器将发作期信号识别为正常节律(漏诊),或将间歇期背景波误判为发作(假阳)。这些对抗样本的物理可实施性提示:当EEG采集设备受到恶意电磁干扰或由低质量电极引入微弱噪声后,临床AI系统可能产生灾难性误判。为此,首都医大团队在对抗训练中引入频域约束(如保留脑电δ节律能量),使模型对临床常见噪声模式(如肌电、眼动伪迹)与对抗扰动具有可区分的鲁棒性,并正开发可解释性验证模块,确保对抗防御不损害对真实病理模式的敏感性。该工作已于《IEEE Transactions on Neural Systems and Rehabilitation Engineering》发表,强调了在神经疾病AI辅助决策中部署对抗性鲁棒性的临床迫切性。