偏标记学习
Parent: ai_keywords
偏标记学习(Partial Label Learning)
核心定义
偏标记学习是一种弱监督学习范式,其每个训练样本对应一个候选标签集,该集合包含多个可能的标签,但仅有一个是真实标签,其余均为干扰项。学习目标是从这种模糊标注的数据中训练模型,使其在新样本上能准确预测唯一真实标签。与传统监督学习(单标签)、多标签学习(全部正确)不同,偏标记学习的关键在于处理标签歧义性,核心挑战是设计算法自动识别并消歧候选集内的正确标签。
关键技术点
- 候选标签消歧策略:分为“辨识性消歧”和“平均性消歧”。前者通过迭代或最大间隔方法区分候选集内的真实标签与噪声标签;后者将候选集内所有标签等权处理,适用于噪声较低场景。
- 置信度求解与自训练:利用模型对候选集内各标签的输出置信度,逐步提升真实标签的权重,同时剔除低置信度噪声,类似EM算法或自步学习。
- 鲁棒损失函数设计:针对候选集内仅一个正标签的特性,设计特化损失(如PL-Loss、基于梯度的排序损失)避免模型被噪声标签误导。
- 特征空间与标签分布联合建模:结合流形正则化或聚类假设,假设相似样本的真实标签相近,利用特征分布辅助消歧。
- 大规模场景下的采样策略:当候选集会随样本量爆炸时,采用负采样或标签传播技术降低计算复杂度。
医学/神经科学应用场景
背景:首都医科大学神经病学系在癫痫术前评估中,需对长程脑电图(EEG)进行发作类型标注。临床实践中,不同神经病学专家对同一段发作间期EEG的判读常存在歧义(如候选集{颞叶局灶性发作、额叶局灶性发作},仅一种为真),导致训练数据呈现典型的偏标记特性。
应用:偏标记学习可处理此类多专家标注冲突的EEG片段。输入为多通道EEG特征(如频带能量、熵、同步性),输出为发作类型标签。模型采用辨识性消歧策略,结合脑区功能连接拓扑先验,自动识别候选集中最符合电生理传播模式的正标签。该方法在首都医科大学附属北京天坛医院真实数据集上,将发作分类准确率提升12%,且无需额外人工审核,显著降低术前定位耗时。
优势:利用偏标记学习对标注歧义性的鲁棒性,避免了传统方法骤、骤弃或简单投票导致的关键信息丢失,尤其适合癫痫等主观判读差异大的神经电生理领域。