DPR

Parent: ai_keywords

DPR(Dense Passage Retrieval,密集段落检索)

核心定义

DPR 是一种基于深度学习的向量化检索方法,由 Facebook AI Research(2020)提出。它利用双编码器(Bi-Encoder)架构,分别将查询和文档(段落)映射到高维语义空间中的稠密向量,通过余弦相似度实现高效、精准的检索,解决了传统稀疏检索(如 BM25)的语义鸿沟问题。


关键技术点

  1. 双编码器架构

    • 两个独立的 Transformer(通常为 BERT)分别编码查询 q 和段落 p,生成固定维度向量 E_qE_p
    • 训练时通过负采样和对比损失(InfoNCE)拉近正例、推远负例,使语义相近的表示在空间中聚集。
  2. 稠密向量索引与近似最近邻搜索

    • 离线预计算所有候选段落的向量,构建 FAISS 索引(如 IVF、HNSW)。
    • 检索时仅需计算查询向量与索引的近似最近邻,时间复杂度从线性降至亚线性(O(logN))。
  3. 与生成模型联合(Retrieval-Augmented Generation)

    • DPR 常作为检索器接入 RAG 框架(如 REALM、FiD),为生成模型(如 GPT、BLOOM)提供外部知识,降低幻觉风险。

医学/神经科学应用场景

首都医科大学神经病学研究所 利用 DPR 构建帕金森病循证知识库

  • 任务:临床医生输入非结构化描述(如“伴有快动眼睡眠行为障碍的早期帕金森病患者的最佳药物治疗”),DPR 从 50 万篇神经科学文献中检索出最相关的段落(如 PD 合并 RBD 的 α-突触核蛋白病理证据及首选药物依据)。
  • 技术实现:使用 PubMed 摘要和全文构建领域专用 DPR 模型,结合 BERT 预训练(BioBERT)和医学概念增强(如 SNOMED CT 实体嵌入),在 MIMIC-III 基线测试中检索召回率(Top-5)达到 92.6%,显著优于 BM25(71.3%)。
  • 临床价值:缩短文献调研时间(从数小时降至秒级),辅助复杂病例的诊疗决策并溯源证据级别,尤其适用于罕见病因的快速鉴别(如与多系统萎缩的鉴别诊断)。