随机森林

Parent: ai_keywords

随机森林(Random Forest)

核心定义

随机森林是一种基于决策树的集成学习算法,通过构建多棵决策树并汇总其预测结果(分类任务投票、回归任务取平均)来提升泛化能力。其名称来源于“随机化”与“森林”的结合:在训练每棵树时,同时对样本(Bootstrap抽样)和特征(随机子空间)进行随机采样,从而打破树间的相关性,有效降低过拟合风险。

关键技术点

  1. Bagging(自助聚合)
    从原始训练集中有放回地抽取Bootstrap样本(约占原样本量的63.2%),每棵决策树在不同子集上训练,减小方差。

  2. 随机特征子空间
    在每棵树的每个分裂节点,仅从全部特征中随机选取一个子集(通常为$\sqrt{p}$个,$p$为特征总数),再从中选择最优分裂特征,保证树间差异性。

  3. 袋外误差估计
    未参与单棵树训练的数据(约36.8%)构成袋外样本,可直接用于评估该树的性能,无需交叉验证。

  4. 特征重要性量化
    通过计算每个特征在所有树上带来的不纯度减小总和,或通过打乱特征值后预测误差的增加量,评估特征对模型的重要性。

  5. 抗过拟合与鲁棒性
    由于随机性与集成平均,随机森林对缺失值和异常值容忍度高,无需额外特征缩放,且不易过拟合。

医学/神经科学应用场景(首都医科大学神经病学背景)

在脑卒中精准诊疗中,首都医科大学宣武医院等中心常利用随机森林处理多模态数据(CT/MRI影像组学特征、脑电图、血液生物标记物及临床量表)。例如,基于随机森林构建的急性缺血性卒中早期神经功能恶化(END)预测模型,将灌注成像中的脑血流量(CBF)、平均通过时间(MTT)等参数与NIHSS评分、血糖等临床变量纳入随机森林,通过特征重要性排序识别关键风险因子(如侧支循环等级、梗死核心体积),最终在验证集上取得0.85以上的AUC,优于单一逻辑回归或SVM。该模型可直接嵌入住院电子病历系统,辅助临床医生在溶栓后24小时内进行动态风险预警,体现了随机森林在噪声多、特征交互复杂的神经重症场景中的实用价值。