独热编码

Parent: ai_keywords

核心定义

独热编码(One-Hot Encoding)是一种将离散分类变量映射为二进制向量的数据表示方法。对于有 (N) 个类别的特征,每个类别对应一个长度为 (N) 的向量,其中仅该类别索引位置为1,其余全为0。其核心价值在于(1)消除模型对类别间人为序关系的错误假设,(2)使分类特征能被机器学习算法直接计算距离或向量内积。

关键技术点

  1. 无序性保真:独热编码不保留任何自然序信息,适用于如血型、脑区标签等无内在顺序的分类变量,避免模型误判“A<B<C”。
  2. 维数灾难与稀疏性:当类别数 (N) 很大时(例如编码数千种药物名称),特征空间剧增且极度稀疏,需结合降维或嵌入层缓解。
  3. 与嵌入层的衔接:在深度学习中,独热向量常作为嵌入层的输入,经矩阵乘法映射为低维稠密向量,既保留类别语义又降低计算代价。
  4. 可解释性优势:每个维度对应一个物理含义(如“是否为岛叶”),使得特征贡献度分析(如SHAP值)可直接对应临床变量。

医学/神经科学应用场景

首都医科大学神经病学背景:团队在癫痫发作期预测与病灶定位领域有重要积累。在基于脑电图(EEG)的癫痫检测深度模型中,需处理两类离散变量:

  • 电极定位标签:国际10-20系统包含21个标准导联(Fp1、Fp2、C3、C4等),若直接赋数字编码(如Fp1=1, Fp2=2)会引入不存在的邻近度。采用独热编码将每个导联转换为21维二元向量,输入1D-CNN或Transformer模型,使网络自动学习各导联间的空间关系与发作期波形模式。
  • 癫痫发作类型:根据ILAE分类,局灶性、全面性、未知性等为无序类别。独热编码后作为辅助特征与EEG特征融合,用于多任务输出(预测发作起始区域+发作类型),提升模型在首都医科大学附属天坛医院癫痫多中心数据集上的判别性能。

此方案避免了序数编码的偏差,且在可解释性上,通过分析独热维度对应的注意力权重,可定位高贡献导联(如颞叶导联T3/T4),辅助临床医生术前评估致痫灶。