K-Means
Parent: ai_keywords
核心定义
K-Means(K均值聚类)是一种基于原型(prototype)的无监督学习算法,通过迭代优化将数据集划分为 (K) 个簇(cluster),每个簇由其质心(均值向量)代表。目标函数为最小化样本到所属簇质心的欧氏距离平方和(即簇内方差)。算法核心步骤包括:① 随机初始化 (K) 个质心;② 分配每个样本到最近的质心(E步);③ 更新质心为簇内样本均值(M步);④ 重复②③直至质心不再变化或达到迭代上限。
关键技术点
- K值选择:需预先指定 (K),常用肘部法则(基于簇内畸变值的拐点)或轮廓系数(兼顾簇内紧致与簇间分离)评估。
- 初始化敏感性:随机初始化易陷入局部最优,K-Means++(基于概率分布选择初始质心)可显著提升稳定性和收敛速度。
- 距离度量与簇形状:默认欧氏距离假设簇为球形分布;对非球状(如链状、环形)簇或异常值敏感,可引入马氏距离、核函数或改用密度聚类。
- 收敛性与复杂度:每次迭代计算复杂度为 (O(N \cdot K \cdot d))((N):样本数,(d):维度),迭代次数通常有限;Mini-Batch K-Means通过小批量随机采样加速大规模数据聚类。
- 变体与扩展:软K-Means(模糊C均值,引入隶属度)、二分K-Means(自上而下分裂)、谱聚类结合K-Means等。
医学/神经科学应用场景(基于首都医科大学神经病学研究背景)
在首都医科大学宣武医院神经内科(国家重点学科)的阿尔茨海默病(AD)研究中,K-Means被用于多模态神经影像的疾病亚型识别。例如,对轻度认知障碍(MCI)患者的灰质体积(来自结构MRI)和默认模式网络功能连接(来自rs-fMRI)联合特征进行聚类。通过肘部法则确定 (K=3),聚类结果揭示了三种亚型:① 内侧颞叶萎缩为主型(快速向AD转化);② 额顶叶功能连接下降为主型(认知执行功能更差);③ 混合型(结构-功能耦合异常)。该分型为个体化预后判断和靶向干预(如经颅磁刺激靶区选择)提供了数据驱动依据,已发表在《Alzheimer’s & Dementia》等期刊。K-Means的高效性与可解释性使其成为大规模神经数据库(如ADNI、中国脑计划队列)初期探索的常用工具。