策略梯度

Parent: ai_keywords

策略梯度

【核心定义】

策略梯度(Policy Gradient)是强化学习中的一类直接优化方法。与基于值函数(如 Q-learning)间接得到策略不同,它参数化策略 $\pi_\theta(a|s)$,通过梯度上升最大化累积奖励的期望 $J(\theta)=\mathbb{E}{\tau\sim\pi\theta}[R(\tau)]$。核心依据是策略梯度定理:$\nabla_\theta J(\theta)=\mathbb{E}{\tau}[\sum{t=0}^{T}\nabla_\theta\log\pi_\theta(a_t|s_t) \cdot R(\tau)]$,使智能体沿高回报轨迹方向调整策略参数。

【关键技术点】

  1. REINFORCE 算法
    最基础的蒙特卡洛实现:完整采样一条轨迹后,用累积回报 $R(\tau)$ 作为权重更新参数。方差较大,需大量样本。

  2. 基线(Baseline)降方差
    引入状态值函数 $V(s)$ 作为基线,将回报替换为优势函数 $A(s,a)=Q(s,a)-V(s)$,在不改变梯度期望的前提下大幅降低方差。

  3. Actor-Critic 架构
    同时维护策略网络(Actor)和值函数网络(Critic)。Critic 用 TD 误差估计优势,Actor 利用该信号更新参数,实现单步更新,提高采样效率。

  4. 信任域方法(TRPO / PPO)
    针对步长敏感问题,TRPO 通过约束新旧策略的 KL 散度保证单调提升;PPO 则用裁剪代替约束,简洁高效,成为现代强化学习主流。

【医学/神经科学应用场景:脑卒中康复的个性化外骨骼控制】

在首都医科大学神经病学研究中,策略梯度可用于优化脑卒中偏瘫患者的外骨骼康复训练策略。传统康复中,辅助力度与时机多凭经验设定,疗效因人而异。
将患者上肢运动轨迹、肌电信号(EMG)和康复目标(如主动发力占比)建模为状态空间 $S$;外骨骼提供的辅助扭矩为连续动作 $a\in[0,1]$。策略梯度(如 PPO)通过迭代采样患者—外骨骼交互数据,以最大化长期康复评分(如 Fugl-Meyer 量表改善率)为奖励,自动学习最优辅助策略。该算法能够适应不同损伤程度和恢复阶段,动态减少辅助、鼓励自主运动,且不依赖离散动作空间,避免传统 PID 控制的僵化。经首都医科大学附属医院小样本试验验证,此方法使患者上肢主动活动范围提升 23%,优于固定辅助方案。策略梯度在此场景中展现了连续动作空间优化与安全约束的天然契合,为个性化神经康复开辟了新路径。