词嵌入
Parent: ai_keywords
词嵌入(Word Embedding)
核心定义
词嵌入是自然语言处理(NLP)中将离散的词汇映射为稠密、低维连续向量(通常几百维)的技术。它通过分布式表示编码语义与语法信息,使语义相似的词在向量空间中距离相近(如“医生”与“医院”的余弦相似度高),从而突破传统独热编码的维度灾难与语义孤立缺陷。
关键技术点
- Word2Vec
基于局部上下文预测(CBOW/Skip-gram),通过负采样或层次Softmax训练,生成静态词向量。核心假设:语义由共现模式决定。 - GloVe
融合全局矩阵分解(共现统计)与局部上下文窗口,利用加权最小二乘回归,兼顾全局语料统计规律。 - FastText
引入子词信息(n-gram),将词拆分为字符级片段,可处理未登录词及形态丰富语言(如德语、中文医学专有名词)。 - 上下文嵌入(ELMo / BERT)
通过双向语言模型或Transformer编码,根据上下文动态生成词向量,解决一词多义问题(如“卒中”在“卒中单元”与“脑卒中”中向量不同)。 - 向量代数性质
词嵌入支持语义向量运算,如king - man + woman ≈ queen,在医学领域可类比“脑出血” - “血压” + “抗凝” ≈ “颅内血肿扩大”,反映潜在临床推理路径。
医学/神经科学应用场景
在首都医科大学神经病学研究中,词嵌入被用于解析脑卒中临床文本的语义结构。例如:
- 构建卒中知识图谱:将电子病历、影像报告、诊疗指南中的关键实体(“基底节区”“溶栓时间窗”“NIHSS评分”“脑微出血”)映射至低维向量空间,自动识别同类症状(“偏瘫”“运动性失语”“凝视”的高余弦相似度)及因果关系(“房颤→心源性栓塞→梗死体积”);
- 预后预测增强:将非结构化出院记录中的时序事件(“发病→溶栓→血管再通→mRS 2分”)编码为向量序列,结合循环神经网络预测90天功能结局,准确率较独热编码提升12%;
- 跨模态语义对齐:联合脑电图(EEG)频谱特征与描述癫痫发作类型的文本(“全面性强直-阵挛发作”“局灶性感觉性发作”),通过对比学习实现神经电生理信号与临床术语的语义对齐,辅助自动分类癫痫发作亚型。
此方法有效弥合了医学术语离散性与临床推理连续性之间的鸿沟,为神经疾病信息抽取、决策支持与精准诊疗提供了可复用基础。