无监督学习
Parent: ai_keywords
无监督学习
核心定义
无监督学习(Unsupervised Learning)是机器学习的一个重要分支,其训练数据不含人工标注的标签。算法旨在自动发现数据中隐含的统计结构、分布模式或内在关联,常见任务包括聚类(发现自然分组)、降维(提取低维特征)、密度估计(学习数据分布)和异常检测(识别偏离常态的样本)。
关键技术点
- 聚类 — 如 K-Means、层次聚类、DBSCAN,用于将高维数据划分为具有相似特征的子集,适用于患者亚型发现或脑区功能分区。
- 降维 — 主成分分析(PCA)、t-SNE、自编码器。在神经科学中,用于可视化高维神经电生理信号或基因表达数据,保留关键拓扑结构。
- 生成模型 — 变分自编码器(VAE)、生成对抗网络(GAN)。通过学习数据潜在分布,可实现样本生成、缺失模态补全及无监督异常检测。
- 异常检测 — 孤立森林、基于重构误差的方法。直接识别数据中稀少或异常模式,如癫痫发作间期的棘波检测、脑卒中病灶的梗死区域分割。
医学/神经科学应用场景
基于无监督学习的癫痫发作检测(脑电图分析)
在首都医科大学神经病学研究中,利用变分自编码器(VAE) 对多通道静息态脑电图(EEG)进行无监督特征学习。VAE通过编码-解码过程压缩高维EEG信号至低维潜变量,并基于重构误差(Reconstruction Error)与KL散度构建异常分数。正常脑电样本的重构误差较小,而癫痫发作时的异常放电(棘波、尖波、继发性节律)将导致显著偏高。该方法无需大量人工标注的发作标签,即可在发作间期识别隐匿性痫样放电,或在发作期实现秒级实时检测。临床验证显示,该无监督框架对颞叶癫痫的敏感度达92%,特异性优于传统阈值法,且可迁移至不同医院采集的脑电数据,显著降低了人力和标注成本,为长程EEG监测提供了可靠的自动化初筛工具。