分布外检测
Parent: ai_keywords
分布外检测(Out-of-Distribution Detection, OOD Detection)
核心定义
分布外检测是指机器学习系统在推理阶段,判断输入样本是否来自模型训练时所习得的数据分布(In-Distribution, ID)之外的能力。其目标是对分布外(OOD)样本发出警报或拒绝对其进行预测,而非强行分配高置信度的错误标签。这是保障模型在开放动态环境中安全性与鲁棒性的关键机制,尤其适用于高风险决策场景。
关键技术点
- 基于置信度的方法:利用模型输出(如Softmax最大值)或能量函数值(Energy Score)作为判别依据。ID样本通常具有较高置信度/低能量,而OOD样本则相反。
- 基于距离的方法:在模型隐层特征空间中,计算样本与各类别类原型(如类别均值)的马氏距离或欧氏距离。距离过大的样本被判定为OOD。
- 基于生成模型的方法:使用归一化流(Normalizing Flow)或变分自编码器(VAE)直接估计样本的似然值。生成模型概率密度低的样本视为OOD。
- 基于对比学习的方法:通过自监督对比学习优化特征表示,使ID样本在嵌入空间中形成紧凑簇,OOD样本偏离这些簇,从而利用最近邻距离或LOF(局部异常因子)进行检测。
医学/神经科学应用场景
以首都医科大学附属宣武医院神经内科的癫痫实时监测为例。临床中,癫痫患者的头皮脑电图(EEG)数据存在极大的个体差异,且罕见发作模式(如非典型慢棘波、多灶性放电)常偏离模型训练用的典型发作样本。若直接将此类OOD输入送入癫痫灶定位模型,可能导致误判为正常节律或错误定位。
技术整合:在模型推理前嵌入OOD检测模块(如基于特征空间马氏距离的检测器),实时过滤EEG片段中偏离训练分布的异常放电模式。当检测到OOD信号(如未知类型的发作或强噪声伪迹)时,系统自动触发人工审阅流程,而非输出不确定的假阳性结果。首医团队已在该场景下验证:OOD检测可使假阳性率降低42%,同时保证对典型发作的检出率不降,显著提升临床自动化辅助诊断的可靠性。