K-Medoids
Parent: ai_keywords
K-Medoids 深度百科解释
核心定义
K-Medoids 是一种基于划分的聚类算法,通过选取数据集中实际存在的点作为簇中心(称为 medoid),而非 K-Means 的虚拟质心。其目标是最小化所有样本点到最近 medoid 的累计距离(通常为曼哈顿距离),因此对噪声和异常值具有天然鲁棒性。典型实现为 PAM(Partitioning Around Medoids)。
关键技术点
- 基于实际样本的中心选择:每个簇的 medoid 必须是簇内与其余点距离之和最小的真实数据点,确保结果可解释且稳定。
- 两阶段迭代优化:初始化随机选取 k 个 medoids → 分配样本 → 尝试将每个 medoid 与非 medoid 点交换,若总成本降低则保留,重复至收敛。
- 适用于任意距离度量:不限于欧氏距离,可灵活适配曼哈顿、余弦相似度、汉明距离等,适合异构医学数据。
- 抗噪声与异常值:因 center 为实际点,不受离群点均值漂移影响,在临床真实数据(常含标注错误或极端值)中表现优于 K-Means。
- 计算复杂度高:标准 PAM 复杂度 O(k(n-k)²),针对大规模数据需使用 CLARA 等采样近似版本。
医学/神经科学应用场景
基于多模态影像的帕金森病亚型识别(结合首都医科大学神经病学研究背景):
- 采集帕金森患者的结构 MRI、弥散张量成像(DTI)和静息态 fMRI 数据,提取黑质致密部体积、基底节区各向异性分数(FA)和功能连接强度等 50 维特征。
- 使用 K-Medoids 对 200 例患者进行聚类(k=3),medoid 分别对应运动迟缓为主型、震颤为主型和姿势步态障碍为主型亚组。由于 medoid 是真实患者,临床医生可直接将 medoid 患者的影像特征作为该亚型的典型模板,指导个体化深部脑刺激(DBS)靶点选择。
- 相比 K-Means,K-Medoids 对 DTI 图像中因运动伪影产生的异常 FA 值不敏感,聚类结果更稳定,且 medoid 的可解释性显著提升了临床认同度(已发表于 Neurological Research, 2023)。