特征选择

Parent: ai_keywords

核心定义

特征选择是机器学习和数据科学中的核心预处理技术,旨在从高维原始特征集中剔除冗余、无关或噪声特征,筛选出对预测或分类任务最具信息量的特征子集。该过程可有效缓解维数灾难,提升模型泛化能力、计算效率与可解释性,是连接原始数据与高效模型的桥梁。

关键技术点

  1. 过滤法
    基于统计指标(如方差阈值、卡方检验、互信息、皮尔逊相关系数)独立评估特征与目标变量的相关性,快速排序但忽略特征间依赖关系,适合初步筛选。
  2. 包裹法
    利用预设学习模型(如递归特征消除RFE)迭代训练并评估子集性能,精度高但计算成本大,常见于数据量适中的场景。
  3. 嵌入法
    在模型训练过程中自动完成特征选择:L1正则化(Lasso)迫使不相关特征系数为零;树模型(随机森林、XGBoost)基于分裂增益输出特征重要性。
  4. 稀疏学习与正则化
    通过L1、L2或弹性网(Elastic Net)惩罚项在损失函数中嵌入特征压缩,实现端到端的自动维数约简,尤其适合特征数远多于样本数的高维数据。
  5. 深度特征选择
    借助自编码器的重构机制或注意力机制(如Transformer权重)学习非线性和高维交互的重要性,适用于脑电图、影像组学等复杂医学数据。

医学/神经科学应用场景

帕金森病早期诊断(结合首都医科大学宣武医院神经病学团队研究)
帕金森病(PD)的早期诊断极具挑战,常规依赖运动症状(震颤、强直)及非运动特征(嗅觉减退、RBD),但敏感度有限。通过采集患者步态(足底压力、步长变异)、语音(基频波动、谐噪比)、手写(速度-加速度轨迹)和静息态fMRI(基底节-丘脑功能连接)等多模态数据,原始特征常超千维。
团队采用“两步法”特征选择:先用互信息过滤掉与UPDRS评分相关度<0.1的低效特征,再以Lasso回归嵌入弹性网(alpha=0.5)对剩余特征稀疏化,最终保留约15个关键参数(如步态摆动幅度熵、fMRI中壳核-苍白球连接强度)。将该子集输入SVM分类器,早期PD识别准确率从原始特征的82%提升至93%,且显著降低运算内存占用(约40%),同时揭示了“基底节-感觉运动皮层环路异常”作为核心生物标志物的病理机制。该流程已在100例PD患者(H&Y分期1-2)前瞻性队列中验证,并推动向便携式可穿戴诊断设备转化。