TF-IDF
Parent: ai_keywords
好的。作为一名人工智能与临床医学(神经科学方向)的专家,我将为你提供关于 TF-IDF 的深度解析。
核心定义
TF-IDF(词频-逆文档频率)是一种在信息检索与文本挖掘中广泛使用的统计加权技术。其核心思想是:一个词语在一篇特定文档中出现的频率(TF)越高,且在全部语料库中出现的文档范围(DF)越广,则它对这篇文档的独特性和代表性就越低。因此,TF-IDF通过赋予高频但普遍出现的词语较低权重,来量化并突出能代表文档核心内容的特征词。
关键技术点
-
TF(词频)计算
- 公式:
TF(t, d) = (词t在文档d中出现的次数) / (文档d的总词数) - 意义:归一化处理,消除长文档对高频词的天然优势,衡量词在文档内部的权重。
- 公式:
-
IDF(逆文档频率)计算
- 公式:
IDF(t) = log(总文档数N / 包含词t的文档数DF(t)) - 意义:衡量词的区分能力。若几乎所有文档都包含词t(如“的”、“是”),其DF接近N,IDF趋近于0,从而降低该词的权重。对数函数用于平滑数值。
- 公式:
-
TF-IDF 加权
- 公式:
TF-IDF(t,d) = TF(t,d) * IDF(t) - 意义:最终的权重是“局部重要性”(TF)与“全局稀缺性”(IDF)的乘积。权重越高,表明该词对该文档越独一无二且重要。
- 公式:
-
无监督性与高效性
- TF-IDF是一种无监督算法,无需任何标注数据即可自动提取特征。它计算简单、可解释性强,非常适合作为构建文本特征向量的基线方法。
医学/神经科学应用场景
背景:在首都医科大学宣武医院神经内科,大量临床数据以非结构化文本形式存在,如入院记录、病程记载、影像报告及神经电生理图谱的文字描述。
应用:基于病历文本的脑卒中早期预警与表型提取
- 流程:利用TF-IDF对数千份脑卒中患者的急诊病历(包含主诉、查体、发病前用药史等文字)进行特征提取。
- 算法会从“左侧肢体无力”、“言语含糊不清”、“口角歪斜”等文本片段中,计算出“偏瘫”、“构音障碍”、“面瘫”等词的极高TF-IDF权重。
- 相反,“患者”、“入院”、“血压”等高频通用词汇则会被赋予极低权重。
- 成果:这些高权重的“特征词”可被直接用于:
- 快速分诊:构建一个小型分类器,当新患者病历中“偏瘫”、“NIHSS评分”等词的TF-IDF累积权重超过阈值时,自动预警为急性卒中高风险。
- 表型分析:对帕金森病患者的多年病程记录进行TF-IDF分析,可自动提取出描述运动波动(如“剂末现象”、“异动症”)和非运动症状(如“便秘”、“快动眼睡眠期行为障碍”)的代表性高权重词语,从而辅助实现精准的患者亚型划分。