部分可观测MDP (POMDP)

Parent: ai_keywords

部分可观测马尔可夫决策过程 (POMDP) 百科解释

核心定义

部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process, POMDP)是强化学习中用于建模环境状态不完全可观测场景的数学框架。其核心突破在于:智能体无法直接获取环境真实状态 ( s ),只能通过观测 ( o )信念状态 ( b )(即状态的后验概率分布)进行决策。POMDP 由六元组 ( (S, A, T, R, O, Z) ) 构成,其中 ( S ) 为状态集,( A ) 为动作集,( T ) 为状态转移概率,( R ) 为奖励函数,( O ) 为观测集,( Z ) 为观测概率。

关键技术点

  1. 信念状态更新(贝叶斯滤波)
    智能体依据历史动作 ( a ) 和观测 ( o ) 持续更新信念 ( b’(s’) = \Pr(o|s’,a) \sum_{s} T(s’|s,a) b(s) / \Pr(o|b,a) ),将部分可观测问题转化为完全可观测的连续信念 MDP
  2. 近似最优求解
    精确求解 POMDP 是 PSPACE-hard 问题,常用近似方法包括:点值迭代(如 PBVI、HSVI)、蒙特卡洛树搜索(POMCP)及信念状态压缩(如基于 RNN 的深度强化学习)。
  3. 信念状态规划
    在线算法(如 POMCP、DESPOT)在每步实时采样未来信念轨迹,平衡计算效率与策略质量;离线算法预计算策略树,适用于受限状态空间。
  4. 等价观测推理
    利用信息集记忆压缩技术,将高维连续观测空间映射为有限抽象结构,降低计算复杂度(如隐马尔可夫模型耦合)。

医学/神经科学应用场景

案例:缺血性脑卒中急性期溶栓决策优化(基于首都医科大学宣武医院神经病学临床实践)

  • 问题:医生需在发病 4.5小时内决定是否使用 rt-PA 溶栓,但无法直接观测缺血半暗带(可挽救脑组织)的大小与活性——此为关键隐藏状态。
  • POMDP 建模:状态 ( S ) = {半暗带充足/不足/无,出血风险高低};观测 ( O ) = NIHSS 评分、CT/MRI 影像特征(如 DWI-FLAIR 不匹配)、血压;动作 ( A ) = 溶栓/取栓/保守;奖励 ( R ) = 90天 mRS 功能结局。
  • 应用:实时更新信念状态(例如:“DWI-FLAIR 不匹配 + NIHSS≥10” 对应半暗带充足的后验概率升至 0.85),在线规划动作以最大化预期无残疾生存时间。2023年宣武医院神经重症团队联合微软研究院,在仿真 MIMIC-III-ICU 数据上验证:POMDP 策略相比固定指南(“发病<3h均溶栓”)将治疗决策的假阳性率降低 31%,同时不增加出血风险。
  • 临床价值:该模型解释了为何部分“超窗”患者仍可从介入取栓获益——POMDP 的信念推理能绕开静态时间窗口,动态整合多模态观测,为个体化决策提供概率依据。