主动学习
Parent: ai_keywords
主动学习(Active Learning)
核心定义
主动学习是机器学习的一种范式,其核心思想是算法自主选择最具信息量的未标注样本,交由专家标注后迭代训练模型,从而以最小标注成本获得最大性能提升。与被动接收随机样本的监督学习不同,主动学习通过查询策略(Query Strategy)动态优化训练集,尤其适用于标注成本高昂的医学领域。
关键技术点
-
不确定性采样(Uncertainty Sampling)
选择模型当前置信度最低的样本(如预测概率接近0.5),认为其处于决策边界,标注后能最显著降低模型熵。 -
查询委员会(Query-by-Committee, QBC)
训练多个模型(委员会),选择成员间分歧最大的样本——分歧越大,说明当前模型对该样本的知识边界越模糊。 -
预期模型变化(Expected Model Change)
计算每个未标注样本若被标注后对模型参数或损失函数的影响度,选择“改动”最大的样本,适合梯度下降类模型。 -
密度加权策略(Density Weighting)
结合样本的代表性和不确定性:优先选择既不确定又位于高密度区域的样本,避免对孤立噪声点过度关注,提升泛化能力。
医学/神经科学应用场景:脑卒中MRI病灶分割
首都医科大学宣武医院神经科在急性脑卒中研究中,需对大量多模态MRI(DWI、PWI)进行病灶像素级标注。传统标注耗时耗力且受主观差异影响。
采用主动学习框架:初始用少量标注数据训练U-Net分割模型,随后对未标注切片计算置信度图(基于熵或边缘响应),自动筛选出边界模糊、小病灶、或跨模态配准差异大的样本,优先交由资深放射科医师标注。经10轮迭代,模型在DICE系数上提升至0.85(对比随机采样仅0.72),且节省了70%标注工时。该策略同时适用于癫痫棘波定位(选择异常脑电片段)和帕金森步态视频分析(提取模糊的冻结步态帧),有效降低了神经电生理数据标注的专业门槛与成本。