集成学习

Parent: ai_keywords

集成学习

核心定义

集成学习(Ensemble Learning)是一种通过构建并组合多个基学习器(Base Learner)来完成学习任务的机器学习范式。其核心思想在于“群体智慧”——单个模型可能因偏差或方差导致性能瓶颈,而集成策略能有效降低泛化误差,提升预测的稳定性与准确率。根据基学习器生成方式,主要分为序列化方法(如Boosting,依赖前序模型错误)和并行化方法(如Bagging,独立构建)。

关键技术点

  1. Bagging(自举汇聚)
    对训练集进行有放回采样,生成多个子集分别训练同质基学习器,最终通过平均(回归)或投票(分类)集成。典型代表:随机森林(Random Forest),通过随机属性选择进一步增加多样性。

  2. Boosting(提升)
    迭代训练序列化模型:每一轮调整样本权重,使新模型更关注前一轮的误分类样本。最终加权组合所有模型。代表算法:AdaBoost、GBDT(梯度提升决策树)、XGBoost,擅长降低偏差,但易受噪声影响。

  3. Stacking(堆叠)
    使用元学习器(Meta-learner)融合多个异构基学习器的输出。基学习器层通常使用交叉验证生成元特征,避免过拟合。常用于多模态数据融合,如影像+临床特征。

  4. Voting / Averaging(投票/平均)
    最简单的集成策略:分类问题采用硬投票(多数决)或软投票(概率平均),回归问题直接取值平均。对基学习器多样性要求较高,否则增益有限。

医学/神经科学应用场景

基于首都医科大学神经病学研究背景,集成学习在脑卒中急性期预后预测中展现显著优势。临床数据(如NIHSS评分、年龄、血糖)与多模态影像(DWI梗死体积、ASL灌注)构成高维异构特征。传统单一模型(如逻辑回归)易受特征共线性影响,而Stacking集成框架可分别训练:

  • 基学习器:随机森林(处理非线性临床指标)、XGBoost(挖掘影像特征交互)、支持向量机(应对小样本高维数据);
  • 元学习器:轻量级Logistic回归或梯度提升机,融合各基模型输出概率。
    在首都医科大学宣武医院回顾性队列中,该集成模型对90天不良预后(mRS≥3)的AUC较单一最优模型提升约5%,且对梗死核心边缘区(半暗带)的误判率降低,为个体化溶栓决策提供鲁棒性支持。此外,癫痫脑电图分析中,Bagging集成多个CNN或LSTM基分类器(不同频段特征),可有效抑制电极伪差导致的假阳性,提升发作检测灵敏度。