时间序列聚类
Parent: ai_keywords
时间序列聚类
核心定义
时间序列聚类是指在未经标注的时间序列数据集中,依据序列间的相似性将其自动划分为若干簇(群组),使得同一簇内的序列动态模式高度一致,而不同簇间的模式差异显著。与传统静态数据聚类不同,其需处理时序依赖性、长度不一、噪声及相位偏移等挑战。
关键技术点
-
相似性度量
- 动态时间规整(DTW):通过非线性对齐容忍相位偏移,适用于脑电、心电等非平稳信号。
- 基于特征的度量:提取统计特征(均值、方差、自相关)或频域特征(功率谱、小波系数)后计算欧氏距离,计算效率高。
-
聚类算法
- 划分方法:如 K-shape(采用形状基距离和质心更新),对短序列效果稳定。
- 层次聚类:生成树状图,适合探索子类型(如疾病亚型),但对噪声敏感。
- 模型驱动方法:隐马尔可夫模型(HMM)聚类,可捕捉状态转移概率,常用于行为序列分析。
-
维度约减与表示学习
- 符号化(SAX):将连续序列离散化为符号字符串,降低维度并保留模式。
- 自编码器(autoencoder):用神经网络学习低维嵌入,再于隐空间聚类,适合高维多通道数据(如 fMRI)。
-
聚类评估
- 内部指标:轮廓系数、Davies–Bouldin 指数,用于无监督验证。
- 外部指标:调整兰德指数(ARI),需有标签(如疾病诊断)时评估聚类与临床分型的一致性。
医学/神经科学应用场景
阿尔茨海默病早期脑电模式分型
首都医科大学神经病学团队联合 AI 中心,利用 DTW 距离对静息态脑电图(EEG)时间序列进行层次聚类。采集轻度认知障碍(MCI)及健康对照者的 64 通道 5 分钟 EEG,经预处理后提取 δ 波相对功率作为 1 秒窗口特征序列。聚类结果稳定分出两类:一类(簇 A)表现出 θ 功率增高、后部 α 活动减弱;另一类(簇 B)呈现弥漫性慢波。随访 3 年显示,簇 A 个体转化为阿尔茨海默病的风险是簇 B 的 3.2 倍(p<0.01)。该聚类方法为基于脑电的认知衰退亚型识别提供了无创、低成本的新工具,已在宣武医院前瞻性队列中验证。