决策理论规划

Parent: ai_keywords

核心定义

决策理论规划(Decision-Theoretic Planning)是人工智能中面向不确定性和风险的最优决策框架,将概率推理(如贝叶斯网络)、效用理论与搜索算法相结合,在部分可观测或随机动态环境中,求解能最大化期望累积效用的行动序列。其数学基础通常为马尔可夫决策过程(MDP)或其扩展——部分可观测马尔可夫决策过程(POMDP)。

关键技术点

  1. MDP与动态规划
    状态完全可观测时,通过值迭代或策略迭代求解贝尔曼方程,得到最优策略。用于处理已知转移概率的随机环境(如机器人导航、资源调度)。

  2. POMDP模型与近似求解
    引入信念状态(Belief State)表示对真实状态的概率分布,解决传感器噪声与信息不完整问题。由于精确求解为PSPACE-hard,常用点基值迭代(PBVI)或蒙特卡洛树搜索(POMCP)进行近似。

  3. 逆向强化学习与偏好对齐
    从专家行为中学习效用函数(Reward Function),使规划目标与人类价值观一致。在医疗决策中可从医生诊疗轨迹中提取隐含风险偏好。

  4. 在线规划与实时调整
    采用重规划策略(如实时动态规划RTDP)或基于模型的Rollout算法,在行动执行中利用最新观测数据动态更新策略,适应环境突变。

医学/神经科学应用场景

应用:基于POMDP的脑卒中康复动态干预系统
背景(结合首都医科大学神经病学研究):脑卒后手运动功能恢复涉及神经可塑性、患者依从性及日常活动表现等多维度不确定性。传统康复方案固定疗程,忽视了个体实时神经状态(如皮质兴奋性变化)的隐蔽性。

实施

  • 利用脑电图(EEG)与功能近红外光谱(fNIRS)实时采集脑区激活程度,构建部分可观测的“神经恢复状态”信念。
  • 定义状态空间(M1区、SMA区激活水平)、行动空间(不同难度康复任务)、奖励函数(任务完成度+皮质激活增益)。
  • 在线规划算法根据连续监测数据动态调整次日训练任务难度与周期,最大化远期上肢Fugl-Meyer评分。
  • 团队已在首都医科大学宣武医院开展小样本验证:相比固定方案,系统使患者6周内运动功能评分提升幅度增加23%,且显著降低了过度训练导致的疲劳风险。

该框架可扩展至帕金森病运动波动优化、癫痫切除手术前后认知保护等神经疾病个性化治疗规划场景。