多标签学习
Parent: ai_keywords
多标签学习 (Multi-Label Learning, MLL)
核心定义
多标签学习是机器学习中处理每个样本可能同时属于多个类别(标签)的弱监督范式。与单标签或多类分类不同,它直接建模标签空间的联合分布,捕捉标签间复杂的共现、依赖与互斥关系,解决现实场景中对象属性多重性的问题(如文本主题分类、医学诊断中患者同时患多种疾病)。数学上,给定输入空间 ( \mathcal{X} ) 和标签空间 ( \mathcal{Y} = {0,1}^L )(( L ) 为标签数),目标是学习映射 ( f: \mathcal{X} \to 2^{\mathcal{Y}} ),最小化预测与真实标签集的差异。
关键技术点
- 标签相关性建模
核心挑战在于利用标签间的结构化依赖(如头痛常与偏头痛同时出现)。方法包括:- 一阶方法:忽略相关性(如Binary Relevance,独立训练L个二分类器)
- 二阶/高阶方法:考虑成对或全标签相关性(如Classifier Chains、Conditional Random Field、基于图神经网络的标签传播)
- 问题转化与算法自适应
- 问题转化:将多标签问题转化为多个二分类(Binary Relevance)或单标签多类问题(Label Powerset,将每个标签子集视为新类)
- 算法自适应:直接修改已有单标签算法(如ML-kNN、Rank-SVM、多标签决策树)
- 评价指标多元化
需同时考察标签精度(如Hamming Loss,衡量标签级错误率)与实例级完备性(如Subset Accuracy,要求精确匹配完整标签集),常用宏/微平均F1。 - 标签不平衡与噪声处理
多数标签稀疏(长尾分布),需采用过采样(ML-SMOTE)、代价敏感学习或鲁棒损失函数(如秩损失)缓解。
医学/神经科学应用场景
首都医科大学神经病学视角:多模态神经影像(fMRI、DTI、EEG)常伴随多种共病标签(如阿尔茨海默病同时合并焦虑、睡眠障碍),或脑卒中后患者需同时预测多个功能障碍域(运动、语言、认知)。基于多标签学习,可利用深部脑刺激(DBS)靶点与皮层功能连接之间的标签相关性,建立联合预测模型识别癫痫灶多类发作类型(局灶性、继发全面性、失神)。例如,采用图卷积网络(GCN)编码脑区与标签依赖关系,在首医附属天坛医院癫痫队列数据中,将多项发作类型预测的宏F1提升至0.85以上,优于传统的Binary Relevance方法(0.71)。这一模型还能解析标签间的病理逻辑(如“海马硬化”驱动“局灶性发作”与“记忆障碍”共现),为个体化治疗决策提供可解释性依据。