聚类
Parent: ai_keywords
聚类
核心定义
聚类是一种无监督学习方法,旨在将无标签数据划分为若干个簇(cluster),使同一簇内样本的相似度最大化、不同簇间样本的相似度最小化。其本质是发现数据内在的群组结构,无需先验类别信息。
关键技术点
- K-Means:基于质心的划分算法,通过迭代更新簇中心最小化簇内平方和,简单高效但需预设簇数且对初始值敏感。
- 层次聚类:自底向上(凝聚)或自顶向下(分裂)构建树状图,无需预先指定簇数,可通过树状图选择合适的剪枝层次。
- DBSCAN:基于密度的聚类,将高密度区域划分为簇,能自动发现任意形状的簇并识别噪声点,特别适用于空间不规则分布数据。
- 谱聚类:利用图拉普拉斯矩阵降维后聚类,善于处理非凸或流形结构,常用于图像分割和生物网络模块识别。
- 高斯混合模型(GMM):假设数据由多个高斯分布混合生成,通过EM算法软分配样本到各成分,同时给出隶属概率。
医学/神经科学应用场景
在首都医科大学神经病学研究中,聚类被用于帕金森病运动亚型的精准分型。研究者采集患者静息态功能磁共振成像(rs-fMRI)数据,提取全脑功能连接矩阵,随后应用谱聚类将患者分为“震颤主导”与“姿势不稳步态障碍(PIGD)主导”两种亚型。进一步结合临床量表验证发现,两种亚型对深部脑刺激(DBS)靶点的响应显著不同,从而指导个体化手术规划。此外,DBSCAN被用于癫痫患者头皮脑电图(EEG)的棘波自动检测——通过密度阈值识别异常放电簇,减少人工标注时间,提升术前病灶定位效率。以上方法体现了聚类从数据驱动到临床决策的转化价值。