稀疏检索
Parent: ai_keywords
稀疏检索 (Sparse Retrieval)
【核心定义】
稀疏检索是一种基于高维、稀疏向量空间模型的信息检索范式。其核心在于,每个文档和查询被表示为一个极高维度的向量,其中大多数分量为零,仅有少数非零分量代表该文本的关键特征(如词频-逆文档频率 TF-IDF 权重)。检索时,通过计算查询向量与文档向量的点积(如余弦相似度)来度量相关性,并返回得分最高的结果。与基于密集向量(如预训练模型嵌入)的稠密检索不同,稀疏检索以高效、可解释、对词汇匹配敏感著称。
【关键技术点】
- 精确词汇匹配与词频统计:依赖倒排索引结构,通过精确匹配查询词项(Token)并累加其权重(如 TF-IDF、BM25)来判定相关性。这是其可解释性的基础。
- 高维稀疏向量表示:向量维度通常等于词典大小(数十万至数百万),每个维度严格对应一个唯一词项。这种表示天然具有稀疏性,便于通过倒排索引实现毫秒级检索。
- 学习型稀疏表示 (Learned Sparse):近年来突破性进展,利用 Transformer 模型(如 SPLADE)学习每个词项的重要性权重,能在保留稀疏性的同时融入上下文语义,弥合词汇与语义鸿沟。
【医学/神经科学应用场景:阿尔茨海默病前瞻性临床研究数据检索】
在首都医科大学宣武医院牵头的一项大规模阿尔茨海默病(AD)早期预警研究中,神经病学团队积累了海量非结构化数据,包括:电子病历(EHR)中的症状描述、神经心理学量表(如MMSE)评分注记、脑脊液生物标志物(Aβ42, p-tau)报告。
挑战:医生需从这些混杂文本中快速检索出具有极早期特征的病例,例如包含“主观认知下降(SCD)”、“海马体轻微萎缩”但MMSE评分正常的患者。稠密检索可能因找不到完全匹配的语义向量而漏检。
应用:采用基于BM25的稀疏检索(进一步通过SPLADE模型优化),对上述文本构建稀疏索引。检索时,输入含“主观认知下降+正常MMSE+海马体积”的查询。系统精准匹配这些关键病理词项,无歧义地召回所有包含该词汇组合的病例报告。其高精确率避免了稠密检索因“语义近似”而引入的不相关(如“皮层萎缩”)结果,确保了前瞻性队列入组的严谨性与可重复性,直接支撑了 AD 超早期诊断的金标准研究。