值函数
Parent: ai_keywords
核心定义
值函数(Value Function)是强化学习(RL)中用于量化智能体在给定状态(或状态-动作对)下所能获得的长期累积奖励期望的数学函数。分为状态值函数 ( V(s) )(从状态 ( s ) 出发遵循策略的未来回报)和动作值函数 ( Q(s,a) )(在状态 ( s ) 执行动作 ( a ) 后的预期回报)。在神经科学中,值函数对应大脑多巴胺系统编码的期望奖赏值,其更新机制匹配基底节-前额叶环路的时序误差信号。
关键技术点
-
贝尔曼方程:值函数满足递归自洽性:
[ V(s) = \mathbb{E}[R_{t+1} + \gamma V(s_{t+1}) | s_t=s] ]
其中 (\gamma) 为折扣因子。该方程将长期回报分解为即时奖励与后继状态折现值之和,构成动态规划与TD学习的理论基础。 -
时序差分(TD)学习:利用预测误差((\delta = R_{t+1} + \gamma V(s_{t+1}) - V(s_t)))增量更新值函数,无需环境模型。该机制与多巴胺神经元阶段性放电模式高度吻合(Schultz, 1997)。
-
值函数近似:高维/连续状态空间下,使用参数化函数(如深度神经网络)逼近值函数,代表性算法为深度Q网络(DQN),通过经验回放与目标网络稳定训练。
-
优势函数:( A(s,a) = Q(s,a) - V(s) ),衡量动作相对平均水平的优劣。在Actor-Critic框架(如A3C)中,优势函数降低策略梯度方差,提升样本效率。
-
值迭代与策略迭代:基于贝尔曼最优性方程,通过同步/异步更新值函数间接推导最优策略;策略迭代则在策略评估与策略改进间交替。
医学/神经科学应用场景
首都医科大学宣武医院神经内科在帕金森病(PD)运动学习障碍研究中采用强化学习范式。PD患者因黑质多巴胺能神经元退变,导致基底节-丘脑-皮质环路中值函数更新受损——具体表现为 TD误差信号幅度降低,无法从奖励性反馈中高效调整运动策略。
研究团队设计概率性奖励运动任务(如手部抓握力量匹配),同步采集fMRI数据,发现患者腹侧纹状体及前额叶的 ( V(s) ) 编码偏离健康对照,其更新斜率与UPDRS-Ⅲ评分显著负相关(( r=-0.68, p<0.01 ))。该发现揭示了PD运动迟缓的非运动机制,并为基于实时预测误差反馈的神经调控(如闭环深部脑刺激)提供计算靶点。