指代消解
Parent: ai_keywords
指代消解(Coreference Resolution)
【核心定义】
指代消解是自然语言处理(NLP)中的一项核心任务,旨在自动识别文本中指向同一现实世界实体的不同语言片段(如代词“它”、名词短语“该患者”与专有名词“李某”)之间的指代关系,并将它们归并为同一个实体簇。其目标是为机器提供连贯的语义理解,消除歧义,实现篇章级的“谁做了什么”推理。
【关键技术点】
- 基于规则的启发式方法
早期利用语法约束(如句法树中的性别、单复数一致性)与语义知识(如动词选择限制)来匹配共指对,但泛化能力弱。 - 基于统计与特征工程的方法
通过构建候选指代对,提取距离、句法路径、语义相似度等特征,使用分类器(如最大熵、SVM)判断共指概率。代表系统如“Soon et al.”的提及对模型。 - 端到端深度神经网络
Lee et al.(2017)提出的端到端模型,直接在文档中生成所有可能的提及跨度,并通过双向注意力机制与打分函数(基于BERT/GPT)完成聚类,无需外部特征,成为当前主流。 - 预训练语言模型(PLM)下的跨文档指代消解
利用RoBERTa、Longformer等模型的长序列建模能力,处理多篇临床报告间的实体对齐,打破单文档限制,适应复杂医学文本。
【医学/神经科学应用场景】
在首都医科大学附属医院神经内科的脑卒中诊疗中,多模态病历(包括急诊记录、放射科报告、神经电生理结果)常通过代词或缩略语指代同一患者体征或病灶。例如:“该患者左侧大脑中动脉闭塞,其(指代‘左侧大脑中动脉’)供血区见低密度影。溶栓后复查,提示其(指代‘闭塞血管’)再通良好。”
利用深度学习指代消解模型,可自动将“其”与“左侧大脑中动脉”“闭塞血管”连接,形成结构化知识图谱:实体–时空关系。系统进一步与神经影像报告中的DWI/ADC序列定量指标(如梗死体积、灌注延迟)关联,辅助神经科医生快速判别“责任血管”与“既往梗死灶”的归属关系,减少因指代模糊导致的误判。该技术已应用于脑卒中中心临床决策支持系统原型,提升电子病历中症状-病灶-治疗因果关系抽取的准确率至92.7%。