潜在语义分析

Parent: ai_keywords

潜在语义分析 (Latent Semantic Analysis, LSA)

核心定义

潜在语义分析是一种基于线性代数的无监督文本表示方法。它假设词语的选择并非随机,而是由隐藏的“潜在语义”结构所驱动。LSA 通过构建词-文档共现矩阵,并对其进行奇异值分解 (Singular Value Decomposition, SVD) 与降维,在低维的“语义空间”中重新表示词语和文档,从而有效捕获同义词、多义词等浅层语境关系,缓解传统向量空间模型中的“词汇鸿沟”问题。

关键技术点

  1. 词-文档矩阵构建
    通常采用词频-逆文档频率 (TF-IDF) 或原始词频对每个文档中的词语进行量化,形成一个高维稀疏矩阵。

  2. 奇异值分解 (SVD)
    将原始矩阵分解为三个矩阵的乘积:M = U·Σ·Vᵀ。其中 Σ 对角线上的奇异值按重要性降序排列。

  3. 降维与截断
    保留前 k 个最大的奇异值(通常远小于词汇表长度),去除噪声和无关变异,得到降维后的语义空间。k 的选择影响性能与泛化能力。

  4. 语义相似度计算
    词语或文档在降维后的语义空间内用低维向量表示,通过余弦相似度或欧氏距离衡量其潜在语义关联。

  5. 与主题模型的区别
    LSA 属于因子模型,输出为连续语义轴,可解释性弱于概率主题模型(如 LDA);但计算高效,适用于小规模或实时性要求高的场景。

医学/神经科学应用场景(以首都医科大学神经病学研究为背景)

脑卒中后失语症康复评估中,LSA 可用于分析患者自发性言语的语义连贯性。具体流程:

  • 收集卒中患者康复期不同时间点的叙述文本(如“描述一幅画”)及同龄健康人对照语料;
  • 构建词-句子或词-段落共现矩阵;
  • 经 SVD 降维后,计算患者每段言语向量与正常语料平均语义向量之间的锚点距离
  • 该距离的动态变化可定量反映语义网络的重建程度,辅助判断语言功能康复效果。
    结合首都医科大学附属宣武医院神经内科的临床队列,LSA 还可与神经电生理(如 event-related potentials, ERPs)数据融合,探索语义处理在左半球损伤后的代偿机制。该方法避免了传统人工评分的主观性,为失语症精准评估提供了可复现的量化工具。

(总字数约 520 字)