TF-IDF

Parent: ai_keywords

好的。作为一名人工智能与临床医学(神经科学方向)的专家,我将为你提供关于 TF-IDF 的深度解析。


核心定义

TF-IDF(词频-逆文档频率)是一种在信息检索与文本挖掘中广泛使用的统计加权技术。其核心思想是:一个词语在一篇特定文档中出现的频率(TF)越高,且在全部语料库中出现的文档范围(DF)越广,则它对这篇文档的独特性代表性就越低。因此,TF-IDF通过赋予高频但普遍出现的词语较低权重,来量化并突出能代表文档核心内容的特征词

关键技术点

  1. TF(词频)计算

    • 公式:TF(t, d) = (词t在文档d中出现的次数) / (文档d的总词数)
    • 意义:归一化处理,消除长文档对高频词的天然优势,衡量词在文档内部的权重。
  2. IDF(逆文档频率)计算

    • 公式:IDF(t) = log(总文档数N / 包含词t的文档数DF(t))
    • 意义:衡量词的区分能力。若几乎所有文档都包含词t(如“的”、“是”),其DF接近N,IDF趋近于0,从而降低该词的权重。对数函数用于平滑数值。
  3. TF-IDF 加权

    • 公式:TF-IDF(t,d) = TF(t,d) * IDF(t)
    • 意义:最终的权重是“局部重要性”(TF)与“全局稀缺性”(IDF)的乘积。权重越高,表明该词对该文档越独一无二且重要。
  4. 无监督性与高效性

    • TF-IDF是一种无监督算法,无需任何标注数据即可自动提取特征。它计算简单、可解释性强,非常适合作为构建文本特征向量的基线方法。

医学/神经科学应用场景

背景:在首都医科大学宣武医院神经内科,大量临床数据以非结构化文本形式存在,如入院记录、病程记载、影像报告及神经电生理图谱的文字描述。

应用基于病历文本的脑卒中早期预警与表型提取

  • 流程:利用TF-IDF对数千份脑卒中患者的急诊病历(包含主诉、查体、发病前用药史等文字)进行特征提取。
    • 算法会从“左侧肢体无力”、“言语含糊不清”、“口角歪斜”等文本片段中,计算出“偏瘫”、“构音障碍”、“面瘫”等词的极高TF-IDF权重。
    • 相反,“患者”、“入院”、“血压”等高频通用词汇则会被赋予极低权重。
  • 成果:这些高权重的“特征词”可被直接用于:
    1. 快速分诊:构建一个小型分类器,当新患者病历中“偏瘫”、“NIHSS评分”等词的TF-IDF累积权重超过阈值时,自动预警为急性卒中高风险。
    2. 表型分析:对帕金森病患者的多年病程记录进行TF-IDF分析,可自动提取出描述运动波动(如“剂末现象”、“异动症”)和非运动症状(如“便秘”、“快动眼睡眠期行为障碍”)的代表性高权重词语,从而辅助实现精准的患者亚型划分。