弱监督学习

Parent: ai_keywords

弱监督学习

核心定义

弱监督学习(Weakly Supervised Learning, WSL)是机器学习的一个分支,旨在利用不完全、不精确或有限的标注信息训练预测模型。它介于完全监督学习(依赖大量精确标注)与无监督学习(无任何标签)之间,核心挑战是:在标注质量或数量不足时,如何从数据中提取有效信号并抑制噪声,从而获得泛化能力强的模型。该范式尤其适用于医学领域——精确标注成本高昂且需要专家耗时参与。

关键技术点

  1. 多实例学习(MIL)
    将样本组织为“包”(bag),每个包赋予一个整体标签,包内实例标签未知。模型需推断哪些实例驱动了包标签,常用于病理图像或脑区功能连接分析——整张切片标为“癌变”,但实际只有部分区域阳性。

  2. 自训练与伪标签
    先用少量标注数据训练初始模型,然后用它对大量无标注数据预测,将高置信度预测结果作为伪标签加入训练集,迭代优化。关键在于置信度阈值选择与噪声控制,避免错误传播。

  3. 一致性正则化
    对同一输入施加不同扰动(如数据增强、Dropout),强制模型输出稳定不变。典型方法有Π模型、Mean Teacher。在无标签数据上利用“预测一致性”作为监督信号,是半监督学习的核心技巧。

  4. 标签噪声鲁棒学习
    设计损失函数(如对称交叉熵、主动学习噪声过滤)或网络结构(如错标样本检测分支),使模型能够从包含错误标注的数据中学习真实模式,适用于众包标注的医疗记录或粗糙的电子病历标签。

医学/神经科学应用场景:脑卒中病灶弱监督分割

背景:脑卒中急性期弥散加权成像(DWI)病灶精确分割是评估缺血半暗带、指导溶栓的关键。但像素级标注需资深神经放射科医生花费数小时,且不同专家间一致性有限。
方法:基于首都医科大学临床数据,采用弱监督框架:

  • 输入:大量仅带有“病灶是否存在”的全局标签(病历报告提取)以及少量精确描边标注的DWI图像。
  • 技术组合:利用多实例学习(将整张影像视为包,病灶区域为正实例)训练初始病灶定位模型;结合自训练一致性正则化对未像素标注数据进行伪标签迭代修正。
  • 成果:在只有5%像素级标注的情况下,达到接近全监督模型(Dice系数0.82 vs 0.84)的分割精度,且对基底节区小梗死灶的检出率提升12%,显著降低医生标注负担,为急救决策提供快速量化支持。