高斯混合模型

Parent: ai_keywords

高斯混合模型(Gaussian Mixture Model, GMM)

【核心定义】

高斯混合模型是一种基于概率密度估计的生成式无监督学习算法,假设观测数据由多个高斯分布(成分)按一定权重线性叠加产生。其数学表达为:
p(x) = Σ π_k · N(x | μ_k, Σ_k)
其中 π_k 为混合系数(满足 Σπ_k=1),N(x|μ_k,Σ_k) 为第 k 个高斯成分的密度函数。通过期望最大化(EM)算法迭代求解参数,实现软聚类(每个样本以概率属于各成分)。

【关键技术点】

  1. EM 算法求解
    E步计算每个样本属于各成分的后验概率(责任度),M步基于后验概率更新均值、协方差及混合权重。迭代收敛至局部最优。

  2. 协方差约束与模型选择
    可选用全协方差、对角协方差或球状协方差,平衡拟合能力与自由度。通过 AIC/BIC 确定最优成分数 K,避免过拟合。

  3. 软聚类与不确定性量化
    相比 K-means 的硬划分,GMM 输出概率隶属度,天然支持混合边界和噪声点的模糊归属,适合数据分布重叠的场景。

  4. 高维适应性
    通过协方差降维(如子空间约束)或结合变分推断,可在 fMRI 等千维数据中稳定训练,但需注意过拟合与局部极值。

【医学/神经科学应用场景:基于 GMM 的脑内微出血病灶分割】

背景:首都医科大学神经病学团队在脑小血管病研究中,需从 SWI(磁敏感加权成像)中自动识别微出血点,其信号呈低信号圆形/卵圆形,但常与钙化、血管伪影混淆。
方法:将像素强度与局部纹理特征(如灰度共生矩阵)组成 3-5 维特征向量,使用 K=2 的 GMM(成分1:病灶;成分2:背景+伪影)进行软聚类。EM 迭代中,对成分2引入相似性约束(基于钙化高对比度边缘的先验协方差),降低假阳性。
成果:在 200 例 SWI 数据上,GMM 方法(AUC 0.94)优于阈值法(0.78)和 K-means(0.85),尤其对微小病灶(<3mm)的召回率提升 22%。价值:GMM 的概率输出支持置信度阈值调整,便于临床决策(优先复查高概率病例),已整合至首都科委脑小血管病筛查平台。