语义相似度
Parent: ai_keywords
语义相似度 (Semantic Similarity)
【核心定义】
语义相似度是指定量衡量两个语言单元(词语、短语、句子或文本)在意义上接近程度的指标。它超越字面字符匹配,聚焦于概念空间中的语义距离,是自然语言处理(NLP)与认知科学交叉领域的核心度量。值域通常归一化至 [0,1],越接近1代表语义越一致。
【关键技术点】
-
基于知识库的计算
- 利用人工构建的语义网络(如WordNet),通过节点间路径长度、深度、IC(信息内容)等计算相似度。代表算法:Wu-Palmer、Lin、Resnik。
- 优点:可解释性强;缺点:覆盖度受限于知识库,难以处理新词及非结构化文本。
-
分布式词向量(静态嵌入)
- 基于大规模语料,通过神经网络(Word2Vec, GloVe)将词语映射为低维连续向量。相似度常用余弦距离或欧氏距离衡量。
- 局限:一词多义、语境无关,无法动态调整。
-
上下文感知的深度模型
- 采用Transformer架构(BERT、GPT系列、RoBERTa),为每个词语生成语境化的动态嵌入。不同上下文下同一词有不同的向量表示,显著提升多义词及长文本语义匹配精度。
- 经典应用:STS(语义文本相似度)基准评测,如SemEval任务。
-
融合外部知识的增强方法
- 将知识图谱(ConceptNet、医学本体SNOMED CT)注入预训练模型,通过实体链接或对比学习优化语义空间。在专业领域(如医学)中减少数据稀疏性。
【医学/神经科学应用场景:脑卒中后语义性失语症的量化评估】
背景:首都医科大学神经病学团队在临床中发现,约20%-40%的脑卒中患者(尤其左半球Broca区/Wernicke区梗死)出现语义性失语症——命名困难、语义性错语(如“狗”说成“猫”)。传统波士顿命名测试依赖主观评分,费时且一致性低。
应用:
- 语义相似度驱动的命名评估:患者口头描述目标图片(如“铅笔”),自动语音转录后,计算其产出词(如“笔”“写字的工具”)与目标词“铅笔”的语义相似度(采用BioBERT+医学本体嵌入)。
- 若相似度<0.3(阈值经BOLD-fMRI验证),提示严重语义损害,可能累及左颞中回后部。
- 语义网络重建监控:康复期每周采集患者自发性语言,构建词汇语义图,计算平均语义相似度变异系数。健康受试者变异度低(0.1-0.15),患者早期可达0.5-0.6,治疗后下降反映语义连接重构。
- 神经电生理关联:将语义相似度得分与事件相关电位(ERP)N400波幅(典型语义加工指标)做跨模态回归,发现语义相似度每提升0.1,N400波幅增加2.5 μV,为“语义-脑电”闭环康复提供定量靶点。
价值:该方案已在首都医科大学宣武医院神经内科初步验证,将失语症评估从定性升级为连续量化,精准指导康复周期与亚分类。