高斯判别分析

Parent: ai_keywords

高斯判别分析(Gaussian Discriminant Analysis, GDA)

核心定义

高斯判别分析是一种生成式分类算法,假设每个类别的特征向量服从多元高斯分布。它通过极大似然估计类先验概率 (P(y)) 以及类条件概率密度 (P(x|y))(即高斯参数),再依据贝叶斯定理计算后验概率 (P(y|x)),据此将新样本归入后验概率最大的类别。当各类协方差矩阵相同时退化为线性判别分析(LDA),不同时为二次判别分析(QDA)


关键技术点

  1. 多元高斯分布假设
    每个类别的特征 (x \in \mathbb{R}^d) 服从 (N(\mu_y, \Sigma_y)),其中 (\mu_y) 为均值向量,(\Sigma_y) 为协方差矩阵。该假设是模型推导的基础,直接影响分类边界形状。

  2. 参数估计与最大似然
    训练数据中,类别 (k) 的先验 (\hat{\pi}_k = n_k/n),均值 (\hat{\mu}k = \frac{1}{n_k}\sum{i:y_i=k} x_i),协方差矩阵 (\hat{\Sigma}k = \frac{1}{n_k}\sum{i:y_i=k} (x_i-\hat{\mu}_k)(x_i-\hat{\mu}_k)^\mathsf{T})。若假设 (\Sigma) 共享,则采用合并协方差。

  3. 决策边界性质
    LDA 产生线性决策边界(因为 (\log\frac{P(x|y=1)}{P(x|y=0)}) 为 (x) 的线性函数),QDA 产生二次决策边界(二次函数)。选择何种形式取决于数据异方差性。

  4. 与逻辑回归的权衡
    GDA 是生成模型,需明确数据分布;逻辑回归是判别模型,直接建模 (P(y|x))。当高斯假设合理(尤其样本量小、分布近似高斯)时 GDA 更高效;当分布失配时逻辑回归更鲁棒。

  5. 正则化与稳定性
    高维小样本下协方差矩阵奇异,需采用收缩估计(如岭回归惩罚)或降维后使用,否则参数估计方差过大,分类性能下降。


医学/神经科学应用场景:帕金森病步态早期识别

背景:首都医科大学神经病学团队在帕金森病(PD)早期诊断中,可利用患者穿戴传感器采集步态时空特征(步长、步速、摆动幅度、足地接触力等)。假设健康对照组(HC)和 PD 组的特征分别服从多元高斯分布,但 PD 组因肌强直和步态冻结表现出异方差性(协方差结构不同)。

应用:采用 QDA 建模,将每名受试者的多维步态参数作为输入。模型根据训练集估计两组的高斯参数,然后对疑似患者计算后验概率。若后验概率 (P(PD|x) > 0.5) 则判为阳性。相比逻辑回归,QDA 能更好地捕捉 PD 组特征间的高相关性(如步长与步速的联动变异),在早期(UPDRS III 评分 <15)即可达到 >85% 的敏感度。首都医科大学团队可进一步整合临床量表(如 Hoehn-Yahr 分级)作为先验,使模型更贴合神经病学实际,辅助社区远程筛查。