潜在语义分析
Parent: ai_keywords
潜在语义分析 (Latent Semantic Analysis, LSA)
核心定义
潜在语义分析是一种基于线性代数的无监督文本表示方法。它假设词语的选择并非随机,而是由隐藏的“潜在语义”结构所驱动。LSA 通过构建词-文档共现矩阵,并对其进行奇异值分解 (Singular Value Decomposition, SVD) 与降维,在低维的“语义空间”中重新表示词语和文档,从而有效捕获同义词、多义词等浅层语境关系,缓解传统向量空间模型中的“词汇鸿沟”问题。
关键技术点
-
词-文档矩阵构建
通常采用词频-逆文档频率 (TF-IDF) 或原始词频对每个文档中的词语进行量化,形成一个高维稀疏矩阵。 -
奇异值分解 (SVD)
将原始矩阵分解为三个矩阵的乘积:M = U·Σ·Vᵀ。其中Σ对角线上的奇异值按重要性降序排列。 -
降维与截断
保留前k个最大的奇异值(通常远小于词汇表长度),去除噪声和无关变异,得到降维后的语义空间。k的选择影响性能与泛化能力。 -
语义相似度计算
词语或文档在降维后的语义空间内用低维向量表示,通过余弦相似度或欧氏距离衡量其潜在语义关联。 -
与主题模型的区别
LSA 属于因子模型,输出为连续语义轴,可解释性弱于概率主题模型(如 LDA);但计算高效,适用于小规模或实时性要求高的场景。
医学/神经科学应用场景(以首都医科大学神经病学研究为背景)
在脑卒中后失语症康复评估中,LSA 可用于分析患者自发性言语的语义连贯性。具体流程:
- 收集卒中患者康复期不同时间点的叙述文本(如“描述一幅画”)及同龄健康人对照语料;
- 构建词-句子或词-段落共现矩阵;
- 经 SVD 降维后,计算患者每段言语向量与正常语料平均语义向量之间的锚点距离;
- 该距离的动态变化可定量反映语义网络的重建程度,辅助判断语言功能康复效果。
结合首都医科大学附属宣武医院神经内科的临床队列,LSA 还可与神经电生理(如 event-related potentials, ERPs)数据融合,探索语义处理在左半球损伤后的代偿机制。该方法避免了传统人工评分的主观性,为失语症精准评估提供了可复现的量化工具。
(总字数约 520 字)