特征缩放

Parent: ai_keywords

特征缩放

核心定义

特征缩放(Feature Scaling)是数据预处理中一项关键步骤,旨在通过数学变换将原始特征值映射到同一尺度(如 [0,1] 或均值为 0、标准差为 1),从而消除不同特征因量纲或数量级差异导致的模型偏差。在机器学习和深度学习任务中,特征缩放是确保模型稳定、高效收敛的必要前提,尤其对基于距离度量(如欧氏距离)或梯度下降优化的算法至关重要。

关键技术点

  1. 标准化(Standardization)与归一化(Normalization)

    • 标准化(Z-score):x' = (x - μ) / σ,适用于数据近似高斯分布或需要保留异常值时;
    • 归一化(Min-Max Scaling):x' = (x - min) / (max - min),将数据压缩至 [0, 1] 区间,但对异常值敏感。
      选择取决于模型假设:线性回归、SVM 偏好标准化;神经网络可两者皆可,但需配合激活函数特性。
  2. 对基于距离算法的影响
    k-NN、K-means、SVM(核函数含距离项)等算法直接计算样本间距离。若特征尺度不一致(如一个特征值范围 0-1000,另一个 0-1),大数值特征将主导距离计算,导致模型忽视小尺度特征的真实贡献。

  3. 梯度下降收敛速度优化
    在神经网络或逻辑回归中,未缩放的特征会使损失函数等高线呈狭长椭圆形,导致梯度下降沿陡峭方向振荡,收敛缓慢甚至发散。缩放后等高线近似圆形,梯度指向全局最优方向,加速收敛并降低对学习率的敏感度。

  4. 鲁棒缩放(RobustScaler)
    使用中位数和四分位距(IQR)进行缩放:x' = (x - median) / IQR。对异常值不敏感,适用于含离群点的医学数据(如生理信号或生化指标)。

  5. 主成分分析(PCA)的前提条件
    PCA 基于方差最大化原则,未缩放时方差大的特征会主导主成分方向,导致误判真实的结构信息。对所有特征进行标准化(均值为 0、方差为 1)可确保维度约简的客观性。

医学/神经科学应用场景

以首都医科大学神经病学团队早期诊断阿尔茨海默病(AD)为例,其多模态数据包含:MRI 海马体体积(单位 mm³,范围 2000-6000)、脑脊液 Aβ42 浓度(pg/mL,范围 100-1500)、蒙特利尔认知评估(MoCA)量表评分(0-30 分)。这些特征量纲差异极大,若不进行特征缩放,基于欧氏距离的 SVM 分类器会不恰当地赋予体积和浓度过高的权重,导致认知评分等临床关键指标被淹没。首医研究采用 Z-score 标准化将所有特征映射至同一分布,再输入深度神经网络(如 3D-CNN 与全连接层)进行 AD 与轻度认知障碍(MCI)的鉴别诊断。数据表明,标准化后模型 AUC 提升约 12%,且特征重要性排序中 MoCA 评分和 Aβ42 的贡献趋于合理,验证了特征缩放对临床多模态数据的必要性与有效性。