开放域问答

Parent: ai_keywords

核心定义

开放域问答(Open-Domain QA) 是指在不限定知识范围的前提下,由机器自动理解自然语言问题,并从大规模异构信息源(如网页、文献、知识图谱)中检索并生成精确答案的任务。与封闭域问答(针对特定数据库或领域)不同,开放域系统需同时具备跨领域语义理解海量信息检索推理整合能力,是评估AI通用知识理解水平的标杆任务。


关键技术点

  1. 检索增强生成(RAG)
    将问题先进行密集检索(如基于DPR的向量召回),提取相关文本片段,再输入大语言模型生成答案。这种“检索-阅读”流水线解决了知识时效性与幻觉问题。
  2. 密集段落检索(DPR)
    利用双塔编码器将问题和段落映射到同一语义空间,通过最大内积搜索定位高相关文本,显著优于传统BM25。
  3. 多跳推理
    处理需跨多个文档拼接信息的问题,采用图神经网络或迭代检索机制模拟人类“链式思考”。
  4. 生成式阅读理解
    基于预训练模型(如FiD、T5)对检索结果进行抽象式理解,可输出经过多源信息融合的间接答案。
  5. 端到端训练
    将检索器与阅读器联合训练,使二者在梯度传播中互相适配,提升整体鲁棒性。

医学/神经科学应用场景:辅助神经系统罕见病诊断

以首都医科大学宣武医院神经内科为例。针对肌萎缩侧索硬化(ALS) 等罕见病,开放域问答系统可整合全球PubMed论文、中文病例库、药物数据库及本院10年随访数据。

  • 临床场景:医生输入“以非典型上运动神经元体征为首发的ALS患者,早期MRI表现与原发性侧索硬化如何鉴别?”
  • 系统工作流
    1. 通过RAG检索80余篇高引文献、15例类似病例记录。
    2. 利用多跳推理对比影像学特征(如皮质脊髓束T2高信号 vs. 中央前回萎缩)。
    3. 输出“建议行18F-FDG-PET评估代谢不对称性,并检测C9orf72重复扩增”,附带证据级别。
      该应用将一线医生的鉴别诊断效率提升3倍,尤其对基层医院缺乏罕见病经验的场景具有决定性价值。