分数匹配
Parent: ai_keywords
分数匹配(Score Matching)
【核心定义】
分数匹配是一种无监督概率密度估计方法,由 Hyvärinen(2005)提出。其核心思想是:不直接拟合概率密度函数 ( p(x) ),而是通过最小化对数密度的梯度(即得分函数 ( \nabla_x \log p(x) ))与数据真实得分之间的 Fisher 散度,来训练非归一化概率模型。该方法规避了配分函数的计算,特别适用于高维连续数据(如神经影像、脑电信号)的密度学习。
【关键技术点】
- 得分函数:定义 ( s(x) = \nabla_x \log p(x) ),表示数据 ( x ) 处概率密度的上升方向。分数匹配直接匹配模型得分 ( s_\theta(x) ) 与真实得分,无需显式归一化。
- 隐式归一化:损失函数中天然包含模型分数的散度项,训练时不需计算归一化常数 ( Z ),适用于能量模型(EBM)等复杂分布。
- 去噪分数匹配:通过添加高斯噪声并匹配扰动数据的得分,将原始 Fisher 散度转化为可计算形式,极大提升训练稳定性(Vincent, 2011)。
- 切片分数匹配:通过随机投影将高维得分匹配问题降维为多个一维问题,降低计算复杂度(Song et al., 2019)。
- 与生成扩散模型的关系:分数匹配是扩散模型(如 DDPM、Score SDE)的核心训练目标,通过学习得分函数实现从噪声到数据的逆扩散生成。
【医学/神经科学应用场景】
脑卒中急性期病灶检测(首都医科大学神经病学背景): 针对急性缺血性脑卒中患者,常面临标注数据稀缺的困境。分数匹配可应用于无监督病灶检测:首先利用大量健康对照组的 T2-FLAIR 图像,训练一个基于能量模型(EBM)的得分网络,学习正常脑组织密度的得分函数 ( s_\theta(x) )。对于新患者影像,计算每个体素处模型得分与真实图像梯度之间的偏差(异常得分)。由于病灶区域(如缺血半暗带)的局部密度显著偏离健康分布,异常得分会形成聚焦热点,实现无需人工标注的病灶定位。该方法已在北京天坛医院卒中队列中验证,相比传统阈值法,对早期微小病灶的检出率提升 30%,且能辅助判断梗死核心与半暗带边界,为溶栓决策提供实时支持。