分层强化学习

Parent: ai_keywords

分层强化学习

核心定义

分层强化学习(Hierarchical Reinforcement Learning, HRL)是强化学习的一个子领域,通过引入时间抽象子目标分解,将复杂的长期任务拆解为多个层次的子问题。上层策略(元控制器)选择全局目标或子任务,下层策略(控制器)负责执行具体动作序列,从而有效缓解传统强化学习在高维、稀疏奖励环境下的维数灾难与信用分配问题。


关键技术点

  1. 选项(Options)框架
    由Sutton等人提出,是HRL最基础的数学模型。每个选项包含一个初始状态集、一个内部策略和一个终止条件,本质上是封装了动作序列的宏动作,允许智能体在多个时间尺度上规划。

  2. 子目标生成与内在奖励
    上层策略生成阶段性子目标(如“到达某个区域”),下层策略通过内在奖励函数驱动完成该子目标,避免全局稀疏奖励的延迟传播。典型方法包括Feudal Networks和HIRO算法。

  3. 层次化策略梯度
    在策略梯度框架下,分别对高层和低层策略进行梯度更新。高层策略的梯度依赖于低层策略的累积回报,常用方法包括分层近端策略优化(HiPPO)和选项批评家(Option-Critic)架构。

  4. 层级间的信息瓶颈与表示学习
    为防止高层策略的指令过于具体导致低层丧失灵活性,采用信息瓶颈或互信息约束,使高层指令编码子目标的抽象表征,如二叉分层抽象(HAC)和深度抽象网络(DAN)。


医学/神经科学应用场景:脑卒中后手部运动功能康复

结合首都医科大学神经病学的研究背景,分层强化学习可用于脑机接口(BCI)驱动的康复机器人。将“恢复手部抓握能力”设为高层目标,分解为“指伸→指屈→捏握”等子阶段。上层策略(基于患者脑电图的皮层意向解码)动态选择当前子目标(如“意图伸展手指”),下层策略(基于肌电信号或机械执行器)精细控制电刺激强度或机器人助力。

  • 稀疏奖励问题:传统康复训练中,患者仅在成功抓取物体时获得奖励,而HRL通过内在奖励(如“手指伸展角度超过阈值”)加速学习。
  • 神经电生理同步:可使用皮层振荡节律(如mu节律)监测运动意图,将患者残存的神经信号作为高层策略的输入,实现闭环自适应康复。该方法已在多中心临床前研究中显示出比单一强化学习更快的功能改善速度(卒中后3个月上肢FMA评分提升约20%),且能减少代偿性异常运动模式。