贝尔曼方程
Parent: ai_keywords
贝尔曼方程
核心定义
贝尔曼方程(Bellman Equation)是动态规划与强化学习的基石,由 Richard Bellman 于 1950 年代提出。它描述了状态值函数 ( V(s) ) 或行动值函数 ( Q(s,a) ) 的递归关系:当前状态的价值等于即时奖励与后续状态折扣期望价值的和。数学形式上,最优贝尔曼方程可写作:
[ V^(s) = \max_{a} \left[ R(s,a) + \gamma \sum_{s’} P(s’|s,a) V^(s’) \right] ]
其中 (\gamma \in [0,1]) 为折扣因子,(P) 为状态转移概率。该方程将序贯决策问题分解为子问题,遵循最优性原理:全局最优策略的子策略也是局部最优。
关键技术点
-
状态值函数与行动值函数
- 状态值函数 (V(s)) 评估从状态 (s) 出发遵循策略 (\pi) 的期望累积回报;行动值函数 (Q(s,a)) 评估在状态 (s) 采取动作 (a) 后的期望回报。两者通过贝尔曼方程相互转化。
-
贝尔曼期望方程与最优方程
- 期望方程用于给定策略的值函数计算(策略评估);最优方程直接给出最优值函数,对应的策略即为最优策略。
-
值迭代与策略迭代
- 值迭代:反复应用最优贝尔曼方程更新值函数,直至收敛。策略迭代:交替进行策略评估(求解期望方程)与策略改进(贪心选择)。两者均依赖贝尔曼方程保证收敛性。
-
折扣因子 (\gamma)
- 控制未来奖励的重要性:(\gamma \to 0) 注重即时奖励;(\gamma \to 1) 考虑长远收益。在医学应用中,(\gamma) 可对应患者对远期康复效果的重视程度。
医学/神经科学应用场景:帕金森病与基底节强化学习模型
首都医科大学神经病学团队在帕金森病(PD)的病理机制与深部脑刺激(DBS)优化方面持续深耕。基底节是运动控制与奖赏学习的核心脑区,其多巴胺能输入(黑质致密部)被证明编码奖励预测误差(RPE),而 RPE 正是时间差分学习(基于贝尔曼方程)的核心信号。
在 PD 中,多巴胺神经元退行性变导致 RPE 信号衰减,使基底节-皮层环路在“状态-动作”价值更新上出现偏差:患者无法准确评估运动动作的长期收益,表现为运动迟缓、动作选择困难。基于贝尔曼方程的强化学习模型可量化这种价值功能障碍,例如:
- 对比健康人与 PD 患者在运动学习任务中的值函数收敛速度,揭示多巴胺缺失对折扣因子 (\gamma) 的影响(患者更偏向短期奖励);
- 利用最优贝尔曼方程设计个性化 DBS 参数:将刺激频率、电压视为动作空间,患者运动改善程度作为奖励,通过值迭代自适应调整刺激参数,实现闭环调控。
这一融合框架不仅解释了 PD 的运动学习障碍,还提供了从神经计算到临床干预的转化路径,体现了 AI 动力学方程在神经病学中的核心价值。