文本分类

Parent: ai_keywords

文本分类

核心定义

文本分类(Text Classification)是自然语言处理(NLP)的核心任务之一,指根据预定义的类别体系,为任意长度的文本自动分配一个或多个离散标签。其本质是将非结构化的自然语言映射到结构化语义空间的过程,广泛应用于垃圾邮件过滤、情感分析、主题标注与医学文书自动编码等场景。

关键技术点

  1. 特征表示与向量化
    传统方法采用词袋模型(Bag-of-Words)或 TF-IDF 将文本转为稀疏向量;现代方法则通过 Word2Vec、GloVe 等静态词嵌入或 BERT、RoBERTa 等上下文感知的动态嵌入(如 [CLS] token)捕获语义与句法信息。
  2. 模型架构演进
    • 统计学习:朴素贝叶斯、支持向量机(SVM)在小样本下表现稳健,但依赖手工特征工程。
    • 深度学习:卷积神经网络(TextCNN)提取局部 n-gram 模式;循环神经网络(LSTM/GRU)建模序列依赖;Transformer 的自注意力机制实现全局语义交互。
  3. 预训练-微调范式
    基于大规模语料预训练的语言模型(如 BERT、BioBERT、ClinicalBERT)在微调阶段仅需少量标注数据即可达到临床级精度,显著缓解医学领域标注稀缺问题。
  4. 多标签与层次分类
    医学诊断往往涉及多标签(如 ICD-10 编码)或层次化标签(如癫痫发作类型→局灶性/全面性→子型),需采用二元交叉熵损失加图卷积或层级注意力机制优化。

医学/神经科学应用场景

首都医科大学神经病学研究所——基于脑卒中院内电子病历的自动化亚型分型
脑卒中急性期治疗决策高度依赖病因学亚型(TOAST 分型:大动脉粥样硬化、心源性栓塞、小血管闭塞等)。传统人工审核多模态报告(影像、实验室、病史文本)耗时且存在主观偏差。
通过构建 BioBERT + 多实例学习 的文本分类模型,对入院后 24 小时内的电子病历片段(神经科查体、影像结论、既往史)进行端到端分类:

  • 输入:结构化与非结构化文本混合(如“右侧大脑中动脉 M1 段重度狭窄,NIHSS 评分 8 分,房颤病史”)。
  • 输出:TOAST 亚型概率分布。
    该模型在首都医科大学宣武医院 2017–2022 年 1.2 万例卒中患者数据上取得 F1 0.91,尤其对心源性栓塞的识别敏感度提升 12%,显著缩短入院至分型时间,为 rt-PA 溶栓或取栓决策提供实时辅助。未来可扩展至癫痫发作类型自动分类(基于临床描述文本)及帕金森病 UPDRS 评分预测,推动神经疾病诊疗的智能化与标准化。