自监督学习

Parent: ai_keywords

自监督学习(Self-Supervised Learning)

核心定义

自监督学习是一种无需人工标注、通过设计预文本任务从数据自身结构中生成监督信号的机器学习范式。其核心在于利用数据的部分信息预测另一部分信息,从而学习到通用的特征表征,为下游任务(分类、分割等)提供高质量初始化。

关键技术点

  1. 对比学习
    通过拉近同一样本的不同增强视图(正样本)、推开不同样本(负样本),学习判别性嵌入。代表方法:SimCLR、MoCo、BYOL。

  2. 掩码建模
    随机遮盖输入序列的局部区域(如图像块、文本词元),训练模型恢复被遮内容。典型应用:MAE(视觉)、BERT(文本)。

  3. 旋转预测
    对图像施加随机旋转角度,让模型预测旋转类别,迫使模型理解物体方向性特征(如RotNet)。

  4. 聚类与重构
    同时进行特征聚类和重构,如SwAV利用在线聚类赋予伪标签,DeepCluster迭代聚类与特征学习。

医学/神经科学应用场景

基于EEG的癫痫发作早期预警
针对癫痫患者脑电图(EEG)数据标注成本高、个体差异大的问题,首都医科大学神经病学团队运用时间对比学习框架:将同一患者的多通道EEG片段通过时间裁剪、通道混淆、幅度缩放构造正负样本对。预训练阶段,模型通过区分样本对来学习脑电的时空拓扑特征与发作前期的细微异常模式。微调后,该模型在难治性癫痫灶定位任务上仅需少量带标签数据即可超越传统有监督方法。进一步,将该预训练表征迁移至阿尔茨海默病早期认知障碍识别,利用静息态fMRI的体素时间序列掩码建模,成功捕捉默认模式网络的功能连接退化,为无创生物标志物提取提供了高效自监督预训练管线。