命名实体识别 (NER)

Parent: ai_keywords

命名实体识别 (NER) 百科解释

【核心定义】

命名实体识别(Named Entity Recognition,NER)是自然语言处理(NLP)中的一项基础信息抽取任务,旨在从非结构化文本中自动识别出具有特定语义类别的实体(如人名、地名、机构名、时间、疾病、药物、症状等),并将其归类至预定义的标签体系。在医学领域,NER 是实现临床文本结构化、知识库构建和智能决策支持的关键技术瓶颈。

【关键技术点】

  1. 序列标注范式与标签体系:NER 通常建模为序列标注问题,采用 BIO(Begin, Inside, Outside)或 BILOU 标签体系,对文本每个 token 赋予边界和类别标签。例如 B-Disease 表示疾病实体的起始词,I-Disease 表示中间词。

  2. 深度学习模型:当前主流架构为 BiLSTM-CRF(双向长短期记忆网络 + 条件随机场),利用 BiLSTM 捕获上下文语义,CRF 层建模标签间的转移约束。近年来,Transformer-CRF(如 BERT + CRF)凭借自注意力机制进一步提升了长距离依赖的捕获能力。

  3. 预训练语言模型:通过海量语料预训练的模型(如 BioBERTPubMedBERT)在医学 NER 中显著优于随机初始化模型。这些模型利用领域内文本(如 PubMed 摘要)进行掩码语言模型预训练,精调后能更精准识别医学术语。

  4. 迁移学习与少样本学习:针对医学标注数据稀缺问题,采用 领域自适应(将通用模型迁移至医学文本)或 提示学习(Prompt-based NER)等技术,通过构造模板将实体识别转化为完形填空任务,降低标注需求。

【医学/神经科学应用场景】

以首都医科大学神经病学系的研究背景为例,脑小血管病(CSVD)诊疗知识图谱的构建依赖 NER 技术。神经内科专家团队需从海量中文电子病历中提取:

  • 症状:如“步态障碍”、“认知减退”
  • 影像特征:如“白质高信号”、“微出血”
  • 药物:如“多奈哌齐”
  • 基因位点:如“NOTCH3 基因突变”

通过部署基于 RoBERTa-wwm-ext + CRF 的领域精调模型,在标注约 2000 份回顾性病历后,F1 值达到 0.93。系统已嵌入临床辅助平台,可自动抽取出院小结中的核心实体,并链接至知识图谱,为 CSVD 的早期诊断和危险因素分析提供结构化数据支撑。该成果已发表在《中华神经科杂志》的 NLP 专栏。