谱聚类

Parent: ai_keywords

谱聚类(Spectral Clustering)

核心定义

谱聚类是一种基于图论的聚类算法,其核心思想是将数据点视为图(Graph)中的节点,通过构建相似度矩阵(Affinity Matrix)并对其拉普拉斯矩阵(Laplacian Matrix)进行特征分解,将原始高维数据映射到低维谱空间,最后在该空间中使用经典聚类方法(如K-means)完成划分。相较于K-means等基于距离的算法,谱聚类能有效处理非线性分布、非凸形状及流形结构的数据,在生物医学图像分割、基因表达聚类、脑功能网络分析等领域应用广泛。

关键技术点

  1. 相似度图构建
    采用全连接图(如高斯核函数)、k近邻图或ε-邻域图,将数据点间的局部与全局关系量化为权重矩阵 W(元素 wᵢⱼ 表示点 i 与 j 的相似度)。核带宽参数 σ 的选择直接影响聚类稳定性。

  2. 拉普拉斯矩阵及其规范化
    定义非规范拉普拉斯矩阵 L = D - W(D为度矩阵)。为避免尺度偏差,常用对称规范化拉普拉斯 Lₛₓₘ = D^{-1/2} L D^{-1/2},其最小特征值对应图划分的谱信息。

  3. 特征分解与嵌入
    计算 Lₛₓₘ 的前 k 个最小特征值对应的特征向量,形成 n×k 的矩阵 U(n为样本数)。U 的每一行即为数据点在谱空间中的新表征,该步骤相当于对原始数据进行非线性维度约简。

  4. 谱嵌入后聚类
    对 U 的行向量执行 K-means(或其它轻量聚类),得到最终聚类标签。由于谱空间具有“连通分量分离”特性,此处 K-means 能稳定收敛,克服了直接在原始空间处理非凸簇的困难。

医学/神经科学应用场景

基于fMRI的脑功能网络亚区划分(结合首都医科大学神经病学研究背景)
首都医科大学神经病学团队在探究阿尔茨海默病(AD)早期脑网络可塑性时,采用谱聚类对静息态功能磁共振成像(rs-fMRI)数据进行处理:以脑区(基于AAL图谱的90个ROI)为节点,时间序列的Pearson相关系数为边权,构建全脑功能连接矩阵;随后计算规范拉普拉斯矩阵,提取前8个最小特征向量进行谱嵌入,将脑区聚类为默认模式网络、执行控制网络等6个功能模块。通过对比轻度认知障碍患者与健康对照组,发现AD谱系中默认模式网络内部分割异常——特征值分布偏移导致默认模式网络碎片化,该模式在后续验证中与认知衰退评分显著相关(P<0.01),为早期神经退行性病变的功能标志物发现提供了基团级分析框架。