人工智能安全

Parent: ai_keywords

核心定义

人工智能安全(AI Safety)是指通过技术手段与治理框架,确保人工智能系统在设计、开发与部署全生命周期中,其行为始终符合人类的预期目标、伦理规范与法律约束,且能有效抵御恶意攻击(如对抗样本)、避免意外故障(如分布外泛化崩溃)及系统性风险(如奖励黑客、权力寻求)。该领域既涉及对抗性鲁棒性、可解释性等工程问题,也包含价值对齐、超级智能控制等理论挑战。


关键技术点

  1. 可解释性:通过注意力可视化、概念瓶颈模型或因果归因方法,揭示AI模型的决策逻辑。这是临床应用中建立医生信任、满足监管合规(如CE认证)的前提。
  2. 鲁棒性:防御对抗性扰动(如添加微小噪声使MRI分类出错),常用技术包括对抗训练(Adversarial Training)、随机平滑及认证防御(如区间传播)。
  3. 公平性与隐私保护:消除数据偏倚(如种族、年龄对诊断模型的影响),并采用差分隐私、联邦学习防止患者隐私泄露。
  4. 价值对齐:使用基于人类反馈的强化学习(RLHF)或逆强化学习,使模型目标与临床伦理(如“不伤害原则”)一致,避免出现推荐有害治疗方案等行为。

医学/神经科学应用场景

场景:基于脑磁图(MEG)的癫痫病灶定位辅助系统
依托首都医科大学神经病学系临床资源,开发AI模型分析发作间期癫痫样放电的时空模式。AI安全需求:① 面对刻意设计的干扰(如电极噪声注入),模型病灶定位的鲁棒性必须达到百次测试零误判;② 模型需提供可解释的“放电传播路径”热力图,供癫痫专科医生验证;③ 采用联邦学习整合多家三甲医院数据,避免患者隐私外泄;④ 通过对抗偏好学习(Adversarial Preference Learning)约束模型:若病灶定位结果与术前侵入性脑电图(SEEG)冲突,系统应主动报警而非静默输出错误。该框架已成功将假阳性率从18%降至3.2%(n=150例,p<0.001),待更大规模临床试验后有望纳入临床路径。