奖励塑形

Parent: ai_keywords

核心定义

奖励塑形(Reward Shaping)是强化学习中的一种辅助教学技术,通过设计额外的、旨在引导智能体探索的奖励信号(即塑形奖励),加速其收敛至最优策略,同时需保证不改变原奖励函数下的最优性。其理论基础通常基于势能函数(Potential-Based),即塑形奖励定义为势能差 ( F(s,a,s’) = \gamma \Phi(s’) - \Phi(s) ),确保策略不变性。

关键技术点

  1. 势能函数设计
    势能函数 (\Phi(s)) 需映射状态空间至实数,其选取直接决定塑形效果。常用方法包括基于先验知识(如领域规则)或自动学习(如逆向强化学习推断专家偏好)。
  2. 最优性保持定理
    Ng, Harada & Russell (1999) 证明:当塑形奖励满足 (F(s,a,s’) = \gamma \Phi(s’) - \Phi(s)) 时,任意原始MDP的最优策略在塑形后保持不变——这是工程正确性的关键。
  3. 稀疏奖励缓解
    在医疗、机器人等任务中,原始奖励极其稀疏(如脑卒中康复中的“举手到位”),塑形奖励可提供频繁的子目标反馈,大幅提升采样效率。
  4. 多源信号融合
    可同时融合连续生理信号(如肌电、脑电)与离散任务信号,构建分层回报函数,实现精细动作的渐进塑形。
  5. 惩罚规避与奖励黑客
    需避免智能体“钻空子”(如重复无效动作获取塑形奖励),通常结合领域约束或惩罚项,保证塑形信号与任务目标一致。

医学/神经科学应用场景:脑卒中后上肢运动康复

在首都医科大学神经病学研究中心的一项实验中,针对脑卒中慢性期患者的腕关节背伸训练,团队设计了基于奖励塑形的闭环神经康复系统。智能体(上肢外骨骼)通过患者健侧运动意图(EEG/EMG解码)和患侧关节角度实时调整辅助力矩。

  • 原始奖励:患侧腕关节达到目标角度(±5°)即获稀疏+1奖励,否则为0。
  • 塑形奖励:定义势能函数 (\Phi(s) = e^{-(θ_{target} - θ_{current})^2 / 2σ^2}),引导智能体渐进逼近目标角度;同时附加“肌电能量-动作平滑度”惩罚项,避免肌肉代偿。
  • 结果:与传统恒定辅助相比,塑形组患者6周后Fugl-Meyer上肢评分平均提升12.3分(p<0.01),且皮层运动诱发电位幅度显著增大,提示塑形奖励有效促进了神经可塑性重组。这一方法已扩展至帕金森病步态冻结干预和癫痫术前电刺激标记优化。