马尔可夫决策过程 (MDP)

Parent: ai_keywords

核心定义

马尔可夫决策过程(MDP)是序贯决策问题的数学框架,由五元组 ((S, A, P, R, \gamma)) 描述:状态空间 (S)(环境所有可能状态)、动作空间 (A)(智能体可选行为)、状态转移概率 (P(s’|s,a))、奖励函数 (R(s,a,s’)) 以及折扣因子 (\gamma \in [0,1])。其核心假设——马尔可夫性(未来状态仅依赖当前状态与动作)——使其成为强化学习与最优控制的理论基石。

关键技术点

  1. 状态与动作空间
    需完整刻画决策环境。连续高维空间常用函数逼近(如神经网络),离散空间则依赖表格式表示。

  2. 转移概率与动态模型
    (P) 定义了环境动力学,是MDP区别于简单马尔可夫链的关键。已知模型时可用动态规划求解;未知则需采样估计(Model-free RL)。

  3. 回报与折扣因子
    累积折扣回报 (G_t = \sum_{k=0}^\infty \gamma^k R_{t+k+1}) 引导智能体平衡短期与长期收益。(\gamma) 接近1注重长远,接近0则短视。

  4. 策略与价值函数
    策略 (\pi(a|s)) 映射状态到动作概率。状态价值函数 (V^\pi(s) = \mathbb{E}_\pi[G_t|S_t=s]) 与动作价值函数 (Q^\pi(s,a)) 衡量策略期望回报。最优策略通过贝尔曼最优方程求得。

  5. 规划与学习
    基于贝尔曼方程的值迭代/策略迭代可精确求解小规模MDP;对未知模型,Q-learning、SARSA等算法通过样本学习最优策略。

医学/神经科学应用场景

帕金森病深部脑刺激(DBS)参数自适应优化(首都医科大学神经病学团队研究背景)
将患者神经生理状态(如基底节场电位功率谱、运动迟缓评分)编码为MDP状态 (S);DBS刺激电流、频率与脉宽为动作 (A);转移概率 (P) 由神经动力学模型与临床观测数据拟合;奖励函数 (R) 为运动症状改善度(UPDRS-III评分降低)与副作用(如异动症)的加权组合。采用策略梯度强化学习模型,在线优化刺激参数,实现闭环DBS调控——在避免过度刺激的前提下最大程度缓解震颤与僵硬。该范式已进入临床前仿真验证阶段,显著优于传统开环参数固定方案。