Word2Vec

Parent: ai_keywords

Word2Vec:词嵌入技术的基石

核心定义

Word2Vec 是由 Google 的 Tomas Mikolov 团队于 2013 年提出的词嵌入(Word Embedding)模型。其核心思想是通过神经网络将自然语言中的词语映射到低维连续向量空间(通常 100–300 维),使得语义相近或语法功能相似的词在空间中距离相近。该技术基于分布式假设——“一个词的含义由其上下文决定”。

关键技术点

  1. CBOW(连续词袋模型)
    利用目标词周围的上下文词(窗口大小固定)来预测当前词。训练快速,适合高频词,捕捉语法信息。

  2. Skip-gram 模型
    反过来,用当前词预测其上下文词。对低频词和罕见语义更敏感,能学习更丰富的语义关系。

  3. 负采样(Negative Sampling)
    将多分类问题简化为二分类(区分真实上下文与随机噪声),大幅降低计算复杂度,提升训练效率。

  4. 层次 Softmax(Hierarchical Softmax)
    利用 Huffman 树结构将 Softmax 归一化从 O(V) 降为 O(logV),适用于词汇量极大的场景。

医学/神经科学应用场景

在首都医科大学神经病学研究中,Word2Vec 可用于基于脑卒中电子病历的预后预测。具体而言:

  • 数据来源:从结构化病历中提取患者主诉、体征、影像报告及用药记录等文本字段。
  • 嵌入训练:将每个词语(如“偏瘫”“失语”“NIHSS”评分相关术语)通过 Skip-gram 模型训练为向量,保留临床语境。
  • 下游任务:将患者所有文本的向量融合(如取平均或 TF-IDF 加权)得到患者表示,输入分类器(如 SVM 或 GRU)预测 90 天改良 Rankin 量表评分(功能预后)。
  • 优势:与传统词袋模型相比,Word2Vec 能捕捉“脑梗死”与“溶栓”之间的语义关联,甚至隐含的共病模式(如“房颤”与“栓塞”的向量距离较近),从而提升预测准确率。

该技术同样可扩展至癫痫发作序列的脑电图特征词嵌入分析,或帕金森病运动功能评分的文本挖掘,为神经疾病智能化诊疗提供语义层支持。