分词
Parent: ai_keywords
分词 (Word Segmentation)
【核心定义】
分词是自然语言处理(NLP)的基础任务,指将连续的文本序列切分成符合语言学规则的词语单元序列。在中文等无空格分隔的语言中,分词是语义理解、信息抽取及下游任务(如命名实体识别、关系抽取)的预处理关键步骤。其准确性直接影响后续分析质量,尤其在高风险领域(如临床医学)中,错误的切分可能导致语义偏差甚至医疗决策误导。
【关键技术点】
-
基于词典的分词
依赖预编译的词库(如《现代汉语词典》),通过最大匹配(正向/逆向)、最少切分等规则实现。优点是速度快,缺陷是对未登录词(如医学术语缩写“NIHSS”)和歧义词(如“湖北省/市”与“湖北省/市卫生局”)处理能力弱。 -
基于统计的分词
利用隐马尔可夫模型(HMM)、条件随机场(CRF)在标注语料上学习字与词标签的转移概率。能自然处理未登录词,但需高质量标注数据。临床文本(如病历)中常引入领域特征(如“偏瘫”作为复合词的概率)。 -
基于深度学习的分词
采用BiLSTM+CRF或预训练模型(BERT、RoBERTa),通过上下文稠密向量表示实现端到端切分。能捕捉医学文本中的长距离依赖(如“左侧大脑中动脉闭塞”中的“左侧”修饰“动脉”),但计算成本较高。 -
歧义消解与未登录词识别
交叉歧义(如“南京市长江大桥”中“市长”与“长江”)和医学缩略语(CHF、TIA)的识别,常结合词性标注或领域实体库(如SNOMED CT)提升鲁棒性。
【医学/神经科学应用场景:基于病历文本的脑卒中早期预警】
结合首都医科大学神经病学团队的研究实践,分词被用于结构化非结构化急诊病历。例如,对于主诉文本“突发右侧肢体无力2小时伴言语含糊”,分词系统需正确切分出“右侧/肢体/无力”“言语/含糊”,并标注时间属性“2小时”。进一步的,通过识别“NIHSS评分=12”“溶栓禁忌证”等实体,系统可自动计算发病至到院时间,辅助触发急性缺血性脑卒中静脉溶栓决策支持。在癫痫领域,分词处理患者日记文本“昨晚睡觉中突然两眼上翻,四肢强直持续1分钟”,切分出“两眼上翻”“四肢强直”等发作特征,结合时间戳生成发作频率曲线,用于抗癫痫药物疗效评估。此外,基于神经电生理报告中文本(如“慢波活动广泛出现,以右前颞区为著”),分词可分离出象限、波形类型、定位术语,为电-症状学映射提供结构化输入。这些应用依赖于对医学术语(如“短暂性脑缺血发作”)的准确切分,以及对否定词(“无呕吐”)与修饰词(“进行性加重”)的精确处理,从而提升神经疾病临床决策的智能化水平。