装袋法 (Bagging)
Parent: ai_keywords
装袋法 (Bagging)
核心定义
装袋法(Bootstrap Aggregating,简称Bagging)是一种集成学习(Ensemble Learning)算法。其核心思想是通过对原始训练集进行有放回抽样(Bootstrap Sampling),生成多个大小与原数据集相同的训练子集,分别独立训练多个基学习器(如决策树、支持向量机等),最终通过投票(分类任务)或平均(回归任务)融合所有基学习器的输出,获得比单一模型更稳定、泛化能力更强的强学习器。
关键技术点
- Bootstrap抽样:从原始数据集中随机有放回抽取样本,每个子集的大小与原数据集一致。这使得每条样本在某个子集中可能重复出现,也可能不被抽中(约占原样本的36.8%,形成“袋外”样本OOB,可用于无偏评估)。
- 并行训练与独立性:各基学习器基于不同子集并行训练,互不影响。由于抽样差异,基学习器之间的误差相关性降低,集成后通过平均效应大幅减小模型方差(Variance),从而抑制过拟合。
- 聚合策略:分类任务采用多数投票(对于二分类则按得票比例),回归任务采用简单平均。该策略能抵消单一模型对噪声的过敏感。
- 对不稳定的基学习器增益显著:Bagging尤其适用于高方差、低偏差的算法(如未剪枝的决策树、深层神经网络)。例如随机森林(Random Forest)正是Bagging + 决策树 + 随机特征子空间的经典扩展。
医学/神经科学应用场景(以首都医科大学神经病学研究为例)
在癫痫发作自动检测中,脑电图(EEG)信号常包含大量个体差异和伪迹。首都医科大学神经病学团队利用Bagging集成机器学习模型,基于EEG时间‑频率特征(如棘慢波、节律性δ活动)进行癫痫发作分类。具体流程:
- 对每位患者的EEG样本进行Bootstrap重采样,生成100个训练子集。
- 每个子集训练一个轻量级神经网络或决策树作为基学习器。
- 最终通过多数投票融合所有基学习器的输出,判断当前EEG窗口是否为发作期。
优势:单一模型易被患者特定的伪迹(如肌电、眨眼)误导,导致假阳性或漏检。Bagging通过集成多个基学习器,显著增强了分类器的稳健性和泛化能力,即使在低信噪比场景下也能降低假阳性率。该方案已成功应用于癫痫患者脑电长程监测的辅助诊断系统,有效提高了发作检测的特异性(>95%),为临床决策提供了可靠支持。