半监督学习

Parent: ai_keywords

半监督学习(Semi-Supervised Learning)

核心定义

半监督学习是机器学习中的一种训练范式,介于监督学习(需全部标注数据)与无监督学习(无需标注数据)之间。其核心思想是利用少量带标签数据大量无标签数据共同训练模型,通过在无标签数据上施加先验或一致性约束,主动挖掘隐含的结构信息,从而显著提升模型在标注稀缺场景下的泛化能力。

关键技术点

  1. 自训练(Self-Training)
    先使用少量标注数据训练一个基模型,对无标签数据进行预测,将高置信度伪标签样本加入训练集迭代更新。简单高效,但易受早期误差累积影响。

  2. 协同训练(Co-Training)
    假设数据可被多个独立特征视角描述,分别在每个视角上训练分类器,用各自高置信度预测为另一视角生成伪标签。适用于多模态数据(如影像+文本)。

  3. 一致性正则化(Consistency Regularization)
    对无标签数据施加随机扰动(如数据增强、Dropout),要求模型对扰动前后的输出保持一致。代表方法包括MixMatch、FixMatch,在医学图像领域尤为有效。

  4. 基于图的方法(Graph-Based Methods)
    将样本视为图节点,边代表相似度,通过标签传播(Label Propagation)或图卷积网络(GCN)将标注样本的标签沿图结构扩散至无标注样本。擅长处理非线性流形结构。

  5. 生成式方法(Generative Models)
    通过变分自编码器(VAE)或半监督生成对抗网络(SGAN)学习数据分布,将分类器作为判别器的一部分,使模型同时捕捉类别内变异与类别间边界。

医学/神经科学应用场景:脑卒中MRI病灶分割(以首都医科大学神经病学研究为背景)

在脑卒中急性期,精准分割梗死区域对治疗决策至关重要。然而,临床中仅有少量MRI扫描具有专家手动标注(成本高、时效差),而大量未标注数据堆积。首都医科大学附属北京天坛医院团队采用一致性正则化框架:

  • 以U-Net为骨干网络,利用少量标注的DWI序列数据进行初始训练。
  • 对大量未标注的T2-FLAIR图像施加随机弹性变形与灰度扰动,强制模型对原始图像与扰动图像输出一致的像素级预测结果。
  • 通过协同训练策略引入不同回波时间的多模态特征(DWI与ADC图),交叉生成伪标签,逐步迭代。
    结果:仅在5%标注数据的条件下,模型Dice系数达到0.85,接近全监督(1%递减)。该方法已被部署于天坛医院脑卒中绿色通道,辅助放射科医生在15分钟内完成核心梗死区定量评估,显著缩短溶栓决策延迟。