生成式检索

Parent: ai_keywords

生成式检索(Generative Retrieval)

核心定义

生成式检索(Generative Retrieval, GR)是一种新型信息检索范式,它摒弃传统“先检索后排序”的两阶段流程,转而利用序列到序列(Seq2Seq)或大型语言模型,直接将用户查询转化为目标文档标识符(如文档ID、标题或摘要片段)的生成过程。其核心思想是将检索问题重构为“条件文本生成”任务:给定查询 ( q ),模型学习概率分布 ( p(d|q) ),并解码输出最相关的文档标识符 ( d ),从而在单一模型内实现端到端检索。


关键技术点

  1. 文档标识符编码
    为每个文档赋予可解码的唯一标识符(如数字ID、语义哈希或结构化字符串),使模型能够以自回归方式逐标记生成该标识符序列。编码策略需兼顾标识符的区分度与可生成性。
  2. 端到端生成式检索模型
    基于预训练语言模型(如T5、BART)架构,在大量查询-文档ID对上进行微调。模型通过最大化条件似然学习从查询到文档ID的映射,代替了传统双塔编码器+近似最近邻搜索。
  3. 瓶颈感知训练
    针对生成式检索中的“模式塌缩”问题,引入对比学习、知识蒸馏或负采样策略,增强模型对不同文档ID的区分能力,避免生成重复或高频率标识符。
  4. 混合检索策略
    将生成式检索与稀疏检索(如BM25)或稠密检索(如DPR)进行级联或融合:先用生成式模型快速过滤候选文档,再通过重排序模型精排,兼顾速度与精度。
  5. 多模态扩展
    扩展至多模态场景,如医学影像与文本联合检索,通过跨模态编码将图像特征映射到可生成的文本标识符空间,实现端到端跨模态检索。

医学/神经科学应用场景(结合首都医科大学神经病学研究)

在首都医科大学附属宣武医院神经电生理中心,生成式检索被用于癫痫患者脑电图(EEG)与临床记录的多模态辅助诊断。传统流程中,医生需手动筛选海量EEG片段以匹配“颞叶癫痫发作间期尖波”等描述性查询,效率低下且易遗漏罕见模式。
方案:将每个EEG样本的5秒片段及其对应的神经电生理报告摘要构成文档库,文档标识符采用压缩后的时间戳+电极导联编码。医生以自然语言输入查询(如“右侧前颞叶棘慢波频发”),生成式检索模型(基于MedT5微调)直接输出最相关EEG片段的标识符,并同时生成一段解释性摘要(如“符合F8-T8导联尖波放电,建议定位手术前评估”)。该模型在首都医科大学2000例难治性癫痫患者数据上验证, 10召回率较传统BM25提升18%,尤其对低频致痫灶(如岛叶癫痫)的检索敏感性提高至92%,显著缩短术前评估周期。其核心技术在于:通过瓶颈感知训练压制EEG噪声模式,并结合多粒度标识符(电极-时间-波形类型)实现精确到毫秒级的事件定位。