ELMo

Parent: ai_keywords

ELMo (Embeddings from Language Models)

核心定义
ELMo(来自语言模型的嵌入)是一种深度上下文化的词表示方法,由 Allen AI 研究所于 2018 年提出。与传统静态词向量(如 Word2Vec、GloVe)不同,ELMo 通过预训练的双向语言模型(biLM)动态生成每个词的向量表示,使同一词汇在不同语境中具有不同的语义表征,从而有效解决一词多义(polysemy)问题。其核心在于:词的向量是完整输入句子的函数,而非固定查询表

关键技术点

  1. 双向语言模型(biLM)
    采用双层双向 LSTM(前向 + 后向)分别建模从左到右和从右到左的上下文。前向 LSTM 根据历史词预测当前词,后向 LSTM 根据未来词预测当前词,联合最大化两个方向的 log 似然。
  2. 深度表示的加权组合
    ELMo 并非仅用顶层 LSTM 输出,而是将 biLM 每一层(词嵌入层 + 各层 LSTM 隐状态)的向量进行任务自适应加权(通过 softmax 归一化系数学习),形成最终的上下文嵌入。这种多层次表征能够同时捕捉句法(低层)和语义(高层)信息。
  3. 字符级 CNN 编码
    输入层使用字符级卷积神经网络(CNN)生成子词级别的原始词表示,解决了未登录词(OOV)问题,对医学术语拼写变体(如“帕金森病”与“PD”)具有鲁棒性。

医学/神经科学应用场景
以首都医科大学神经病学系对脑卒中电子病历(EHR) 的语义解析为例:

  • 问题:临床文本中“左侧肢体无力”“口角歪斜”等描述常与“左侧大脑中动脉梗死”“急性期”等诊断关联,但同一词汇(如“左侧”)在不同上下文中可能指代病变侧或症状侧,静态向量无法区分。
  • ELMo 方案:将出院小结、影像报告等非结构化文本输入预训练后的 biLM,生成动态上下文化嵌入。例如,“左侧”在“左侧大脑中动脉”中的向量会聚焦于解剖部位语义,而在“左侧肢体感觉减退”中则偏向症状方位。这些嵌入作为特征输入至下游分类器(如脑梗死亚型预测模型),显著提升 NIHSS 评分自动提取的 F1-score(从 0.82 至 0.91),并辅助识别卒中再灌注治疗适应症的隐含语言模式。此外,ELMo 还可用于癫痫发作期临床电生理报告中复杂术语的消歧(如“棘波”“尖波”在不同导联上下文中的特征编码),推动临床决策支持系统的语义增强。