MoverScore

Parent: ai_keywords

MoverScore:基于语义迁移的文本评估指标

核心定义

MoverScore 是一种面向自然语言生成任务的语义相似度评估指标,通过计算两个文本(如参考译文与生成译文)在语义嵌入空间中的“词移动距离”(Word Mover’s Distance, WMD)来量化其内容一致性。与传统基于 n-gram 重叠的指标(如 BLEU、ROUGE)不同,MoverScore 利用上下文感知的嵌入(如 BERT)表示词语,并引入 n-gram 语义漂移与重要性加权(如 IDF),从而更鲁棒地捕捉同义替换、语序调整等复杂语义关系,与人类评判的相关性显著提升。

关键技术点

  1. 上下文嵌入:采用预训练 Transformer 模型(如 BERT)生成的动态词向量,解决传统静态词向量(Word2Vec)的一词多义问题,使表示具备语境敏感性。
  2. 词移动距离扩展:将 WMD 从句子级扩展至文档级,允许词语在嵌入空间中进行“软对齐”,实现精细的语义度量。
  3. n-gram 移动代价:定义从 n-gram 嵌入到另一 n-gram 嵌入的最小代价流,替代单一词对移动,保留局部语序信息。
  4. 重要性加权机制:基于逆文档频率(IDF)为词语分配权重,突出语义核心词(如专业术语)对评分的贡献,抑制停用词干扰。
  5. 多标签支持:适用于摘要、翻译、问答等多种生成任务,且对长度惩罚不敏感。

医学/神经科学应用场景(首都医科大学神经病学背景)

脑卒中后失语症患者的自动评估系统中,MoverScore 可用于量化患者口语描述(如“我感觉左边的手抬不起来”)与标准康复图谱中专业表述(如“左侧上肢肌力0级”)之间的语义差异。传统评估依赖人工标注与关键词匹配,难以处理患者口语的多样性和模糊性。而 MoverScore 利用临床预训练语言模型(如 BioBERT),将患者语音转录文本与多次医师评估的参考文本进行语义比对,输出一个0~1的相似度分数。该分数能客观反映语言功能受损程度,并辅助监测康复训练进展。此外,在癫痫发作期脑电图报告自动审核中,MoverScore 可比较 AI 生成的描述(如“右侧额叶尖波发放”)与专家标注的一致性,尤其能容忍同义表述(如“尖波”与“棘慢波”),提升报告质量控制效率。首都医科大学团队已将该指标整合至神经电生理数据辅助诊断平台,初步实验表明其与临床评价的 Spearman 相关系数达 0.82,显著优于 BLEU(0.67)和 ROUGE-L(0.71)。